- Apache POI Word 教程
- Apache POI Word - 主页
- Apache POI Word - 概述
- Apache POI Word - 安装
- Apache POI Word - 核心类
- Apache POI Word - 文档
- Apache POI Word - 段落
- Apache POI Word - 边框
- Apache POI Word - 表格
- Apache POI Word - 字体和对齐
- Apache POI Word - 文本提取
- Apache POI Word 资源
- Apache POI Word - 快速指南
- Apache POI Word - 有用的资源
- Apache POI Word - 讨论
Apache POI Word - 文本提取
本章介绍如何使用 Java 从 Word 文档中提取简单的文本数据。如果你希望从 Word 文档中提取元数据,请使用 Apache Tika。
对于 .docx 文件,我们使用 org.apache.poi.xwpf.extractor.XPFFWordExtractor 类,用于从 Word 文件中提取并返回简单数据。类似地,我们有不同的方法用于从 Word 文件中提取标题、脚注、表格数据等。
以下代码展示如何从 Word 文件中提取简单的文本,−
import java.io.FileInputStream; import org.apache.poi.xwpf.extractor.XWPFWordExtractor; import org.apache.poi.xwpf.usermodel.XWPFDocument; public class WordExtractor { public static void main(String[] args)throws Exception { XWPFDocument docx = new XWPFDocument(new FileInputStream("createparagraph.docx")); //using XWPFWordExtractor Class XWPFWordExtractor we = new XWPFWordExtractor(docx); System.out.println(we.getText()); } }
将上述代码另存为 WordExtractor.java。从命令提示符中对其进行编译并执行,如下所示:−
$javac WordExtractor.java $java WordExtractor
它将生成以下输出:
At tutorialspoint.com, we strive hard to provide quality tutorials for self-learning purpose in the domains of Academics, Information Technology, Management and Computer Programming Languages.
广告