PDF / 图像文本提取器
PDF 文件通常有两种格式:
- 单层 PDF:每页就是一张图片。你看到的每个字其实是像素,无法选中复制,也无法搜索。
- 双层 PDF:底层是图片,上面叠加了一个透明的识别文字层。你看上去和单层文件一样,但可以选中文字、复制粘贴、Ctrl+F 搜索。一般由 OCR 软件生成。
对于双层 PD F 文件,本系统可以直接读取文本内容,用于 AI 写作使用。
对于单击 PDF 文件,则需要先使用本工具,先将图像中的文字识别并提取出来保存为参考资料。这个过程通常称为 Optical Character Recognition(光学字符识别,简称 OCR )。
本工具调用“阿里云”等第三方厂商的技术接口进行单层 PDF 文本提取。
说明:
- OCR 提取文本的完整性、准确性,取决于原始文件中字体的清晰度、排版的复杂度等多种因素。即使最先进的 OCR 技术,目前前无法完美实现所有内容的完整、准确提取。因此,根据你对 AI 创作所使用的参考资料的严谨性要求,你可能需要进一步核对提取后的内容。
- OCR 技术厂商通常按页面数量进行收费,每页可能消耗几分或几毛钱的费用,是成本较高的服务。对于试用客户,本系统不提供免费额度。
- 你也可以使用其他众多 OCR 工具或产品,实现单层 PDF 文件的文本提取。
文章润色器
通常,AI 所创作的文章总总是或多或少带有机器创作的特征,在语法风格、体例结构等各方面与人工创作有所不同。
本系统在 AI 创作过程中,已经使用多种技术尽量优化和消除这些机器创作的特征。但如果对于 AI 创作的书籍内容仍不满意,你可以使用本工具进一步加工润色。
除了对书籍章节内容润色之外,你也可以将其他文本粘贴至本工具中进行润色。
说明:
- 可以在本工具中直接导入 AI 所创作的书籍的某个章节,也可直接粘贴其他文本,但每次润色的文本总长度限为 10000 字符;
- 润色后的内容可以导出为 Word 或 Markdown 文件,但不支持直接回写至书籍中替换原有章节内容(这样有可能破坏原书风格和结构);
- 润色工具也将消耗一定的 Token 额度(可以 AI 调用日志中查看消费记录)。
- 本工具主要使用由 Siqi Chen 开发的 Humanizer 技术。