把PDF转成文本

把PDF中的全部文字取到TXT文件里,方便搜索、编辑并在任何地方再利用。

从PDF提取文字——只要内容,不要排版

有时您要的只是文字本身。需要引用合同里的某一条、把报告喂给脚本、在极长的文档里找一个数字,或者把手册的内容搬到另一个系统里——这时PDF精心设计的排版反而碍事。提取成纯文本,您得到的是没有分栏、没有页眉、没有格式的内容,装在任何程序都读得懂的文件里。

上传PDF后,文字会被提取并写入一个随时可下载的TXT文件。由于纯文本不带格式,结果比原文档小得多,在记事本、TextEdit、任何代码编辑器或脚本中都能瞬间打开。用来搜索、建索引、复制到别的应用或送入自动化处理都很合适。

有一个重要限制。这个工具读取的是PDF内部保存的文字层,因此适用于从Word、Excel、浏览器或排版软件导出的文档。而扫描纸张得到的PDF装的是页面的照片而不是字符,没有可提取的文字层,结果会是空的——那种情况需要光学字符识别。如果想连同格式一起取回,请使用「PDF转Word」。服务免费,处理完成后会删除您的文件。

常见问题

怎么从PDF中提取文字?

在本页上传文档并下载生成的TXT文件——提取通常只要几秒钟。

为什么输出文件是空的?

那份PDF几乎肯定是扫描件。扫描页是文字的图像而不是文字本身,没有光学字符识别就没有可提取的内容。

格式会保留吗?

不会,这是刻意为之:纯文本没有格式。您得到的是按阅读顺序排列的文字,没有字体、分栏和样式。若需要版式,请使用「PDF转Word」。

表格怎么办?

表格的内容会作为文字提取出来,但表格本身的网格无法在纯文本文件中表现。若需要可用的表格,请转成Word。

使用什么编码?

文字以UTF-8写出,这是支持所有文字系统的标准编码,因此中文和其他非拉丁文字都能正确输出。

这个工具免费吗?

免费,不用注册,没有每日上限,提取一结束PDF就会从服务器删除。