开发手册 欢迎您!
软件开发者资料库

Apache POI Word - 文本提取

Apache POI Word文本提取 - 从简单和简单的步骤学习Apache POI Word,从基本到高级概念,包括概述,Apache POI安装,核心类,文档,段落,边框,表格,字体样式和对齐,文本提取。

本章介绍如何使用Java从Word文档中提取简单文本数据.如果您想从Word文档中提取元数据,请使用Apache Tika.

对于.docx文件,我们使用类org.apache.poi.xwpf.extractor.XPFFWordExtractor从Word文件中提取并返回简单数据.同样,我们有不同的方法从Word文件中提取标题,脚注,表格数据等.

以下代码显示如何从Word文件中提取简单文本&minus ;

import java.io.FileInputStream;import org.apache.poi.xwpf.extractor.XWPFWordExtractor;import org.apache.poi.xwpf.usermodel.XWPFDocument;public class WordExtractor {   public static void main(String[] args)throws Exception {      XWPFDocument docx = new XWPFDocument(new FileInputStream("create_paragraph.docx"));            //using XWPFWordExtractor Class      XWPFWordExtractor we = new XWPFWordExtractor(docx);      System.out.println(we.getText());   }}

将上述代码保存为 WordExtractor.java.编译并执行它命令提示符如下 :

$javac WordExtractor.java$java WordExtractor

它将生成以下输出:

At it1352.com, we strive hard to provide quality tutorials for self-learningpurpose in the domains of Academics, Information Technology, Management and ComputerProgramming Languages.