Image to Text Converter 运行在 imagetotext.info 域名下,是一款浏览器端的 OCR 服务,用于从图片和扫描件中提取文字。它是一个真正独立的产品,而不是换了品牌的套壳站:它提供有完整文档的 REST API、四个应用商店的上架版本,以及公开的价格体系,这些都需要实打实的工程投入来维护。
它的核心机制并非自研,而且官网自己就说了。站内介绍写明该工具由 tesseract-ocr 驱动,那是一款由惠普开发、由谷歌出资并维护的开源软件。这份坦率值得肯定,同时也把你的预期校准到了正确位置:识别质量大体等同于 tesseract 的水平,即对清晰的印刷体表现优秀,而对手写体、异形字体和低对比度照片则较弱。
该服务接受 JPG、PNG、GIF、JFIF(JPEG)、HEIC 与 PDF,上传方式支持拖放、点选与粘贴三种,而不是只能走文件选择框。输出分为纯文本与保留格式两种形态,可下载为 TXT 或 DOCX,保留格式的结果还能导出为 HTML 或 Markdown。
该站两份官方页面之间存在直接且未被澄清的矛盾,而且恰好落在用户最在意的问题上。转换器界面写着:你的隐私受到保护,不传输也不存储任何数据。而服务条款写的正相反:上传的文档或文本(数据)被存储在我们的服务器上,其摘录会以匿名方式与互联网及内部数据库进行比对。
这两段文字都是在为本页做调研时从线上站点实际取回的。它们不可能同时为真。服务条款文档还明显陈旧——标注的最后更新日期是 2020 年 10 月 1 日,且文中出现了「抄袭检测分析」的字样,这强烈暗示该文本是从一款查重产品复用过来、从未针对本产品重写。这是最合理的善意解释,但解释不等于澄清。在运营方把两份页面对齐之前,请把「是否存储」当作悬而未决的问题,不要把机密材料交给这个免费网页工具。
转换器提供 Simple OCR 输出纯文本,以及 Formatted Text 保留整体版式与格式,包括表格、列表与标题。这个区分的意义比乍看之下更大。从表格里做纯文本提取,拿回来的是一串失去关联的数值;而保留格式模式才能让表格类素材免于手工重建就可直接使用。它消耗的积分也是前者的十倍,这本身就说明运营方把哪一项视为高阶能力。
这是该服务属于工程化产品而非薄壳前端的最有力证据。API 请求的基址是 https://www.imagetotext.info/api/imageToText,认证方式为在 Authorization 头中以 Bearer token 形式携带密钥——这是规范且正确的设计。
该 API 接受三种输入形态,灵活度高于不少同类 OCR 接口:multipart 文件直传、指向远端文件的 image_url,以及把数据内联携带的 base64 字符串。三者各自对应不同的接入场景:用户上传走 multipart,已存于你自己存储中的资产走 URL,而不愿多绕一次网络往返的流水线则走 base64。
文档明确给出了限流响应:超限时返回 invalid_request 类型,消息为「你已被封禁 1 小时」。把封禁时长公开出来是件小事,却能替接入方省下实打实的排查时间,也说明这套 API 是为外部使用而写,而非事后补上的。
除图像转文本外,该站还提供 JPG 转 Excel、图像翻译、PDF 转 Excel、PDF 转 Word、Word 转 Excel 与 PPT 转 PDF,每一项都有各自的额度与体积上限。其中图像翻译是尤为合理的搭配:先 OCR 再翻译本就是常见的两步任务,把两步放在一处可以省去一次来回。
该工具宣称可识别二十种以上语言,涵盖英语、西班牙语、俄语、德语、法语、韩语、日语、汉语、阿拉伯语等。这是继承自 tesseract 的能力而非自研成果,但覆盖面确实存在,且无需额外配置即可使用。
运营方列出了四个分发渠道:iOS 应用、Play Store 应用、Microsoft Store 桌面应用与 Snap Store 包。上架到四个商店意味着持续的打包与审核工作,纯做流量的联盟站点不会费这个力气。
最契合的用途,也是 tesseract 最擅长的一类。报纸、旧办公文档与印刷报告,只要原件干净、字体常规,转换结果就相当可靠。这正是免费工具真能替代付费软件的场景。
用手机拍下的课堂笔记与讲义幻灯片是天然的输入源,而这里 HEIC 支持尤其重要,因为那是 iPhone 的默认照片格式。不少 OCR 工具至今仍不接受 HEIC,会强迫你先做一次格式转换。
从横幅、名片或报名表上摘取联系方式,是一件手工做起来很枯燥的小事。在这类任务里,单张识别率的重要性低于省下的时间,因为短字符串你本来就会核对一遍。
JPG 转 Excel 针对的正是「原件是拍摄或扫描的表格」这一情形。请把积分成本算进预算——每张 20 credits,是站内最贵的操作,大约是一次普通 OCR 的二十倍。
拍下一页,跑一遍图像翻译,就直接跳过了转录环节。这对旅行证件、外文包装与往来信函很实用,但要留意常见的注意事项:对 OCR 结果再做机器翻译,会把两层误差叠加起来。
API 把这项服务变成了基础设施:读取票据的报销工具、为扫描件建立索引的内部系统、提供文字捕获的移动应用。Bearer token 模式与三种输入形态让接入相当直接,而公开的价格让你在动手写代码之前就能估算成本。
任何机密材料,在存储矛盾被澄清之前都不适合。手写体同样不适合,那是 tesseract 的弱项;风格化过重或对比度过低的原图也是如此——修正输出花的时间会超过你省下的。
这一步要排在所有事情之前。既然首页与条款在存储问题上互相打架,就采用保守解读:假定上传内容可能被留存。公开或非敏感材料没问题;合同、病历、身份证件以及任何受保密协议约束的东西则不行,至少不该通过免费网页界面处理。
OCR 的准确率在上传之前就基本定了。正对拍摄而非斜着拍,光线均匀且避免反光,并裁切到只剩文字区域。这里花上十秒,胜过事后任何程度的修正。
官方给出的流程是:上传图片或拖放进来,若有链接则输入网址,点击 Convert,然后复制文本或另存为文档。其中粘贴是被低估的一项:截图可以从剪贴板直达转换,中间不必落地成文件。
如果你只要文字、反正后面还要重新排版,就用 Simple OCR。如果结构本身承载信息——表格、发票、表单,凡是带栏目的——就用 Formatted Text。考虑到十比一的积分差,在量大的时候有意识地做这个选择是实打实地省钱。
这一步别省,并且要对官网自称的「100% 准确率」保持怀疑,任何 OCR 引擎在任意输入上都做不到这一点。尤其留意数字、专有名词,以及任何无法靠上下文验证的内容——表格里一个读错的数字,危害远大于句子里一个读错的词。
后续还要程序处理就选 TXT,要编辑就选 DOCX,保留格式的结果若要进网页或文档站,就选 HTML 或 Markdown。这里选对了,后面就少一次转换。
一旦进入批量转换,网页界面就成了瓶颈。API 的计费与网页套餐彼此独立,所以在决定之前,请拿你真实的月用量分别对两套价格算一遍。
该站一边说自己基于 tesseract,一边宣称 100% 准确率。tesseract 是一款能力不错的引擎,但没有任何 OCR 系统能在任意真实图片上做到完美,这句宣称更适合当作推广语而非技术指标。第三方用户反馈也支持这种怀疑态度——见下面关于版式的说明。
第三方评论中最一致的抱怨不是字符准确率,而是结构。汇总后的用户反馈指出,该工具并不总能保留原图的轮廓、版式或格式,结果有时会被排成一整行或被重新排列。凡是结构复杂的材料,都请预留一轮人工整理的时间。
免费访问按账号状态分档:注册用户每天 50 次转换,访客用户每天 30 次。注册是免费的,却能把上限抬高三分之二,所以只要你要转的图不止几张,就没有理由以访客身份使用。
积分消耗并不统一,而且差距很大。Simple OCR 每张 1 credit,Formatted Text 每张 10,图像翻译每张 15,JPG 转 Excel 每张 20。按普通 OCR 估算出来的套餐,如果你的真实工作是表格提取,消耗速度会快上二十倍。
它并不是通常意义上的「终身」。条目写明为一次性支付 120 美元、有效期 1000 天、含 120,000 credits。一千天大约是两年零九个月。它也许仍然划算,但你应该按「固定期限的预付款」来定价,而不是按永久授权。
该政策逐条列出了不予退款的具体情形,包括改变主意、误解功能、部分已使用、以促销折扣价购买、自动续费扣款以及定制方案。获准的退款会原路退回,银行手续费从退款金额中扣除,审核周期为二至三个工作日。其中「折扣购买不予退款」这一条最容易让人栽跟头,因为人们恰恰是在打折时下单的。
单次张数、单文件体积与每分钟请求数都随档位变化,且区间很大:免费档为每次 5 张、7MB、每分钟 50 次请求,而 BUSINESS 档为每次 150 张、30MB、每分钟 1500 次请求。如果你是为一次批量作业挑选套餐,真正先卡住你的可能是单次张数上限,而不是积分余额。
服务条款明确禁止脚本化访问,要求只能通过其提供的界面与说明使用。若需要程序化访问,API 才是被许可的路径,抓取网页前端属于违反条款。
免费档最契合的人群。转换印刷文章、图书馆扫描件与讲义幻灯片都在 tesseract 的能力范围内,每日额度足以覆盖现实的课业量,而且这类材料通常不涉密。
同样合适,但有一个前提:材料不能是敏感的。供应商发来的发票、印刷版目录与归档信函都没问题;人事档案与已签署的合同则应等到存储问题澄清之后再说。
被服务得最好的一群人,因为 API 是这个产品最扎实的部分。文档化的认证方式、三种输入形态、公开的限流行为与透明的价格,已经足够让你把它和云厂商放在一起做评估,而在中等用量下它通常比大型云服务更便宜。
服务得很好,而且几乎不花钱。访客使用无需注册,每天三十次也远超偶发需求。
任何处理受监管数据或机密数据的人,在两份页面达成一致之前都该另作选择。主要输入是手写体的人,用专门的引擎效果会更好。需要合同层面准确率保证的人也不适合,因为条款明确否认了对准确性与可靠性的任何担保。而需要企业合规文档的人同样不适合,一个两人团队很难提供这类材料。
网页版转换器是主产品,无需安装也无需注册即可使用,其余一切都围绕它构建。
列出的四个分发点覆盖了主要的桌面与移动平台:iOS、Google Play、Microsoft Store 与 Snap。其中 Snap 包值得一提,因为小团队通常最先砍掉的就是 Linux 支持。
程序化访问是一条一等公民级的通道,拥有自己的文档、自己的认证方式与自己的价格阶梯,与网页订阅彼此独立。
隐私政策把运营主体标明为 imagetotext.info, Inc. 一家公司,及其子公司与关联方。公开信息显示这是一个位于巴基斯坦费萨拉巴德的极小团队。小团队做出好工具本身没有任何问题,但这能解释法务页面为何陈旧,而且如果你原本期待企业级的支持承诺,这一点就与你相关。
隐私政策明显比服务条款更新、也更详细,是了解该服务如何处理数据的更好依据。它定义了一个 User Content 类别,涵盖你在使用服务过程中上传、输入或以其他方式传输的全部文本、文档或其他内容与信息——这实际上承认了你的上传内容会被接收并归类,而这一点与转换器页面「不传输任何数据」的说法并不协调。
它还披露了自动收集的范围:根据 IP 地址推断的大致地理位置,以及日志数据、使用行为与设备信息。这对网页服务而言属于常规做法,但值得知道的是,即便你以访客身份匿名使用,服务端仍会留下痕迹。
在支付方面,政策说明若你选择 PayPal 付款,你需要把信用卡号直接提供给 PayPal,该信息适用 PayPal 自身的隐私政策。把卡号交给支付通道而非自行经手是正确的设计,也减少了运营方所掌握的关于你的信息。
在结构上,该政策共 35 节,包含 COPPA 儿童在线隐私条款、California Online Privacy Protection Act 专节、面向欧洲经济区用户的专章,以及一条说明如何删除个人数据的条目。实务上最值得记住的是「有一条书面的删除路径」:如果你上传了不希望对方留存的东西,是存在正式申请删除的机制的。
月付价格为 BASIC 每月 8 美元含 7,000 credits、STANDARD 每月 10 美元含 15,000 credits、BUSINESS 每月 40 美元含 100,000 credits。对应的年付价分别标为 60、84 与 200 美元,对愿意一次性承诺的用户是相当可观的折扣。
它与订阅并列展示,结构却不同:一次性支付 120 美元,含 120,000 credits,有效期为 1000 天。在认定它更划算之前,请在积分数与有效期两个维度上,把它和年付 BUSINESS 放在一起比较。
登录后每天 50 次,访客每天 30 次。对相当多的用户来说,这就已经是产品的全部了,而且它确实可用,不是阉割版的演示。
由于单次操作耗费 1 到 20 credits 不等,套餐上标注的积分总数在你按自己的实际工作构成加权之前,几乎没有参考意义。先按操作类型估出月用量,相乘,再挑档位。
与网页访问分开计价:Tester 每周 9 美元含 5,000 credits、有效期 7 天;Business 每月 24 美元含 25,000 credits;Enterprise 每月 49 美元含 60,000 credits。按周计费的 Tester 档是个合理的做法——先拿你自己的图片实测准确率,再决定要不要按月投入。
可退情形很窄,排除条款却很具体——其中包括折扣购买不予退款。请在下单前而不是下单后读这些条款,尤其当你正赶在促销期购买时。
企业级选项,值得注意的是该站自己在 FAQ 里主动点了它们的名。它们在困难输入上的准确率更高,并提供合同化的数据处理条款与合规文档。代价是更贵,而且需要开通云账号。如果你的材料涉密,仅「数据处理条款清晰」这一点就足以证明多花的钱是值得的。
既然这项服务跑在 tesseract 上,你完全可以自己免费跑同一个引擎。这样你就拥有了完整的数据控制权——材料根本不离开你的机器——代价是要自行安装、调参并搭建界面。对于有隐私约束的开发者,这才是显而易见的答案。
免费、即时、在设备本地完成,从构造上就是私密的。要从海报上抓个电话号码,你手机里已有的 OCR 在速度与隐私两方面都胜过任何网页服务。只有当你需要批量处理、结构化导出或 API 接入时,本工具才更可取。
当原件本身就是 PDF、且目标是生成保留版式的可检索文档时,它们更合适。价格更高,而且如果你只是想从照片里取几行字,它们过于笨重。
非敏感材料、用量不大,或是给业余项目找一个便宜的 API,就用本工具。当准确率、合规或规模确实要紧时,用大型云厂商。当数据不能离开你的掌控时,在本地跑 tesseract。一次性的抓取,用手机就够了。
把它直白地再说一遍,因为这是本页最重要的一件事:转换器界面声称不传输也不存储任何数据,而服务条款写明上传的文档或文本被存储在运营方的服务器上。两份官方页面,相反的主张,且没有给出任何调和。最可能的解释是条款文档陈旧、从另一款产品复制而来,但「可能的解释」不等于「保证」,你应当按保守的那一侧行事。
服务条款标注的最后更新日期为 2020 年 10 月 1 日,且至今仍在讨论抄袭检测分析——一项本产品并不提供的功能。自 2020 年以来就未曾维护的法律文本,不足以用来描述该服务在 2026 年的实际行为,这削弱了它所包含的每一项承诺,包括那些听起来令人安心的部分。
一边跑在 tesseract 上、一边宣传 100% 准确率,是任何 OCR 产品都无法支撑的主张。引擎不错,但在任意输入上达到完美并不可行。与此同时,服务条款否认对结果的准确性或可靠性作任何担保,于是营销承诺与合同立场指向了相反的方向。
汇总的评论反馈把版式保留而非字符识别列为反复出现的抱怨,输出有时会被压成一行或被重新排序。如果你的原件带有实质性的视觉结构,请预留恢复结构的时间。
市面上流传的若干评测文章,引用了官网任何地方都找不到的规格——精确到 99.80% 的准确率、SharePoint 集成,以及 100 credits 的免费额度。这些都无法与运营方自己的页面相互印证,且数字与官方文档相互冲突。它们读起来像推广稿而非实测,本页不采信其中任何内容。
一个位于费萨拉巴德的两人团队完全可能做出好用的 OCR 工具,而 API 的质量也表明他们确实做到了。他们难以提供的,是企业级支持、合规证明或长期存续的保证。如果你考虑把 API 变成一项依赖,请把这一点计入权衡。
针对网页界面的脚本与爬虫被明确禁止,API 才是被许可的路径。这是行业惯例,但值得在团队里有人动手写抓取脚本之前先说清楚。
改变主意、误解功能、部分已使用、折扣购买与自动续费扣款,全部被列为不予退款。再结合年付与 LIFETIME 这两种预付选项,这意味着账面价值最好的档位,恰恰在工具不合预期时给你留下的余地最少。请先用免费额度或按周的 API 档位试过再说。
是免费的,但有每日上限,而且登录后上限会提高。注册用户每天 50 次转换,访客用户每天 30 次。付费套餐从每月 8 美元含 7,000 credits 起步,其存在意义主要是抬高这些上限,并解锁保留格式输出、表格提取等更昂贵的操作。
这一点确实不清楚,也是该工具最重要的未决问题。转换器页面称不传输也不存储任何数据,而服务条款称上传的文档或文本被存储在运营方服务器上。条款的日期是 2020 年且提到抄袭检测分析,暗示它是从另一款产品复制过来的,但矛盾本身并未解决。在运营方澄清之前,请勿上传机密材料。
对清晰的印刷体表现不错,对手写体、异形字体或光线不佳的图片则较差。该站宣传 100% 准确率,而这是任何 OCR 引擎在实践中都达不到的,其自身条款也否认对准确性或可靠性作任何担保。既然它跑在 tesseract 上,就按 tesseract 的水平预期结果,并且永远要核对数字。
JPG、PNG、GIF、JFIF(JPEG)、HEIC 与 PDF,可通过拖放、选择文件或粘贴上传。HEIC 支持值得一提,因为那是 iPhone 的默认照片格式,而许多同类工具并不接受。
有,而且文档写得不错。请求发往 https://www.imagetotext.info/api/imageToText,密钥以 Bearer token 形式放在 Authorization 头中,接受文件上传、图片链接或 base64 字符串三种输入。API 计价与网页套餐分开,从每周 9 美元的 Tester 档起步。
因为它做的事确实多得多。Simple OCR 每张 1 credit,Formatted Text 每张 10,差价反映的是重建表格、列表与标题所需的额外工作,而不只是吐出一串扁平的词。如果你本来就打算重新排版,就用纯文本模式。
不是。它的计费方式是一次性支付 120 美元、有效期 1000 天、含 120,000 credits,也就是大约两年零九个月。请把它当作固定期限的预付套餐来判断,而不是永久授权。
有时可以,但排除范围很广。改变主意、误解功能、部分已使用、折扣购买与自动续费扣款均被列为不予退款。获批的退款经原支付渠道返还,银行手续费从中扣除,通常在二至三个工作日的审核之后到账。
该服务提取的是你自己提供的文字,因此输出的权利状态一般随原始材料的权利而定——OCR 并不会在他人的文档上创造出新的权利。运营方声明不对其产品适用于任何特定用途或受众作出主张,也不对结果负责,所以如果原件是第三方内容,你能否再利用取决于该内容自身的授权,而不取决于这个工具。
支持,覆盖二十种以上语言,包括西班牙语、俄语、德语、法语、韩语、日语、汉语与阿拉伯语。此外还有一个独立的图像翻译工具,可在一次操作中完成 OCR 与翻译,每张 15 credits。