利用Lucene和 XPDF 来处理pdf文件

/*
 * 利用Lucene和 XPDF 来处理pdf文件
 * */
package pdfbox;


import java.io.File;
import java.io.IOException;


public class Pdf2Test {
//PDF文件名
private File pdffile;

//转换器的存放位置,默认为E:\\xpdf下
private String CONVERTOR_STORED_PATH = "E:\\xpdf";

//转换器的名称, 默认为pdftotext
private String CONVERTOR_NAME = "pdftotext";

//构造函数,参数为pdf文件的路径
public Pdf2Test(String pdffile) throws IOException {
this(new File(pdffile));
}


//构造函数,参数为PDF文件对象
public Pdf2Test(File file){
this.pdffile = pdffile;
}

//将PDF转化为文本文档
public void toTextFile() throws IOException{
toTextFile(pdffile, true);
}

//将PDF转化为文本文档,参数为目标文件的路径,默认使用PDF文件的布局
public void toTextFile(String targetfile) throws IOException{
toTextFile(new File(targetfile), true);
}

//将PDF转化为文本文,参数一维目标文件的路径
//参数2位true,则表示使用PDF文件中的布局
public void toTestFile(String targetfile, boolean isLayout) throws IOException{
toTextFile(new File(targetfile), isLayout);
}


//将PDF转化为文本文档,参数为目标文件
public void toTextFile(File targetfile) throws IOException{
toTextFile(targetfile, true);

}

//将PDF转换为文档,参数一维目标文件
//参数二位true,表示使用了PDF文件中的布局
public void toTextFile(File targetfile, boolean isLayout) throws IOException{
String[] cmd = getCmd(targetfile, isLayout);
Process p = Runtime.getRuntime().exec(cmd);
}

//获取转换器
public String getCONVERTOR_STORED_PATH(){
return CONVERTOR_STORED_PATH;
}


//设置PDF转换器的路径
public void setCONVERTOR_STORED_PATH(String path){
if(!path.trim().endsWith("\\"))
path = path.trim() + "\\";
this.CONVERTOR_STORED_PATH = path;
}

//解析命令行参数
private String[] getCmd(File targetfile, boolean isLayout){
//命令字符
String command = CONVERTOR_STORED_PATH + CONVERTOR_NAME;

//PDF文件的绝对路劲
String source_absolutePath = pdffile.getAbsolutePath();

//输出文本文件的绝对路径
String target_absolutePath = targetfile.getAbsolutePath();

//保持原来的layout
String layout = "-layout";

//设置编码方式
String encoding = "-enc";
String character = "GBK";

//设置不打印任何消息和错误
String mistake = "-q";


//页面之间不加入分页
String nopagebrk = "-nopgbrk";

//如果isLayout为false,则设置不保持原来的layout
if(!isLayout)
layout = "";
return new String[]{
command, layout, encoding, character, mistake, nopagebrk, source_absolutePath, target_absolutePath
};

}



public static void main(String[] args) {
// TODO Auto-generated method stub
try{
//参数输入PDF文件的存放位置
Pdf2Test p2t = new Pdf2Test("E:\\Lucene项目\\C语言代码.pdf");

//设定转换器的位置
p2t.setCONVERTOR_STORED_PATH("E:\\xpdftest\\xpdf");

//设置文本文件存放的位置
p2t.toTextFile("E:\\Lucene项目\\XPDF\\");
}catch(Exception e){
e.printStackTrace();
}
}


}

郑重声明:本站内容如果来自互联网及其他传播媒体,其版权均属原媒体及文章作者所有。转载目的在于传递更多信息及用于网络分享,并不代表本站赞同其观点和对其真实性负责,也不构成任何其他建议。