更新:
当您扫描手写文档时,ScanLens会先增强图像 — 调整对比度、去除背景噪声、补偿不均匀光线。目的是把墨迹笔触从纸面分离出来,为识别提供更干净的输入。
系统识别独立的文本行,再把每行切分为词与字符。这比听起来更复杂 — 手写常出现不一致的间距,行书字母会连在一起。先进算法识别自然断点,并保留连写字母不被错切。
当应用结合上下文评估字符 — 而不是孤立看每个字母 — 识别效果最好。当某字母含糊时,系统利用相邻词、间距与行结构做出更合理的猜测,并把结果留到可校对的状态。
语言模型最后一遍利用词汇与语法知识纠错。这一步会按上下文捕捉「prv」→「pre」或「b」→「be」之类的错。这就是为什么识别经常能从粗糙输入产出连贯的句子。
决定结果好坏的最大因素不是应用,而是这些字当初是怎么写的。在这一点上说实话,能让你在扫一整叠纸之前就把预期摆正。
工整的正楷是最容易的情况。当字与字分开、间距稳定时——就像大多数人写购物清单、填表格或写印刷体标题那样——识别的效果接近印刷文字。每个字都能被单独切分出来,所以引擎读它几乎和读打印页一样可靠。如果你能决定某样东西怎么写下来(你自己填的表、你有意做的笔记),把字写清楚就是通往干净转换最稳妥的路。
清楚的连笔可用,但更难。连着写会抹掉引擎用来切分字符的空隙,它只能推断一个字在哪里结束、下一个从哪里开始。工整而稳定的连笔——倾斜一致、笔画成形、墨色对比够——能转成扎实的初稿,只需要轻读一遍,尤其要核对专有名词和数字,这些是语言模型猜不出来的。字迹越干净规整,连笔就越接近正楷的水平。
潦草或匆忙的字迹会迅速变差。这里是诚实的边界。赶时间写的笔记、塌成一团的笔画、末尾拖成一道线的词、厚重的涂改、挤在横线之间的字——这些都超出了任何识别器能分辨的范围,因为纸面上的信息本身就是含糊的。结果依然是个有用的起点,往往比从头打字更省事,但要做好逐行订正的准备。上限来自可读性,而不是软件:人看着都要眯眼的字,引擎也一样。ScanLens 里识别出的文字可以直接编辑,所以你改的是读错的词,而不是重打整页。
有两件常被混为一谈的事值得分开说。Apple 的 Vision 能识别印刷文字,覆盖很广的文字体系——14 种语言,涵盖拉丁、西里尔、阿拉伯与 CJK 文字。但手写识别的范围要窄得多:它训练在那些手写形态较为稳定、数据也更充足的文字体系上。
实际使用中,结果取决于字迹的程度不亚于取决于文字体系:字与字分开、大小稳定、在素白纸上用深色墨水写的内容,比匆忙的涂写好认得多。与其相信一份笼统的排名,不如拿自己写的一页试一次——这比任何泛泛之谈都更快回答你自己的问题。
换成其他文字体系,情况就不同了。像阿拉伯文这样的连写体系,以及手写的CJK(中文、日文、韩文),手写比印刷难得多——区分字符靠的正是笔画细节,而这恰恰是匆忙书写最先丢掉的东西。这些情况下,工整地按印刷体书写并以高分辨率拍摄,识别效果远好过自由手写;14 种语言的印刷文字支持,在 OCR 应用页面里有说明。
良好光线至关重要。日光或明亮均匀的人造光最佳。避免页面上有阴影 — 把光源放在侧边而不是正上方。干净对比强烈的背景有助于边缘识别。
iPhone保持与纸面平行,不倾斜。透视失真让字符识别更难。相机端稳 — 抖动会显著降低准确度。文本密集时分段扫描,而不是一次拍整页。
如果数字化的笔记可读性不一致 — 先关注最清晰的部分。识别出的文字保持可编辑,复杂部分总能后期手动修正:对照原页通读一遍,改正人名与数字。
识别前请先选定与页面相符的语言 — 这会缩小引擎参考的词库,提高准确度,对中文字符尤其明显。多语种文档最好按语言分段扫描以获得更佳结果。
把一页手写内容变成可编辑文字,一共四个阶段,而且全部在手机上完成。
把手机端平、与纸面平行地拍摄,别让字迹发生倾斜;让画面充满,以获得最高分辨率。如果你已经有手写内容的照片或扫描版 PDF,直接导入即可——识别的工作方式完全一样。
启动文字识别,让本机引擎读这一页——一页大约一两秒。开始之前先把语言设成与手写内容相符的那一种,这会给识别器一个更小、也更准的词汇范围。
识别结果会以可编辑文字的形式出现。把它和原件对照着读一遍,改掉引擎读错的地方——通常是专有名词、姓氏和数字,这些是任何语言模型都无法凭上下文猜出来的。工整的正楷几乎不用改;匆忙的连笔要改得最多。
把整理好的文字复制到备忘录、邮件或文字处理软件里。如果想既保留原页面、又能在日后找到它,那就改为导出一份可搜索的 PDF:识别出的文字会以看不见的一层留在扫描件背后。若需要真正的 Word 文档,把文字交给 Pages 或 Word,再从那里导出 .docx。
把会议或课堂的手写笔记转成可搜索可编辑文本。快速查找信息,不用翻笔记本。把笔记分享给缺席的同事。从草稿生成任务与待办。
数字化手写表单、申请表与问卷。提取数据用于电子表格与数据库。适合医疗问卷、反馈卡、活动报名以及任何需要数字化的纸质数据采集。
把私人信件与日记记录数字化。建立家族通信的可搜索档案。为家谱研究转录旧文档。把不可替代的手写记忆备份到云端。
科研、研究人员与田野工作者常以手写记录观察。把田野笔记转成结构化数据。把手写观察整合进数字研究流程。即便是现场仓促的笔记也能保留可读记录。
识别质量取决于多个因素。给一个范围比假装有一个数字适用于每本笔记本、每张表单或每页日记更诚实:
| 手写风格 | 典型结果 | 说明 |
|---|---|---|
| 清晰印刷体(楷书印刷字) | 通常较强 | 清晰间距与良好对比效果最佳 |
| 清晰行书 | 通常可用 | 连笔字母可能需要复核 |
| 风格混合 | 结果不一 | 上下文有帮助,但仍以复核为常态 |
| 仓促/快速 | 需要复核 | 仓促段落预期需要手动修正 |
| 非常潦草 | 有限 | 可读性是任何扫描器的硬上限 |
实务规则简单:清晰手写常能很快变成可用草稿;仓促或不一致的内容则在依赖前先复核更稳。
能。当字迹足够可读时,行书可被识别,但连笔字母、紧密间距与不均匀墨迹仍会降低可靠度。把输出当作可编辑草稿,重要句子在保存或发送前先复核。
结果取决于字迹清晰度、光线、对比度与扫描稳定性。整洁的书写加良好间距比仓促或风格化笔记容易得多。清晰照片与好光线提升结果,重要的人名、日期与数字仍建议核对。
公开的App Store页面标注支持14种以上语言的OCR。手写识别的覆盖范围比印刷文字更窄,并会因文字系统、书写风格和图像质量而变化。请用具有代表性的页面测试,并将重要结果与原始扫描件核对。
支持。所有手写识别都通过Neural Engine在iPhone上完成。扫描与文本提取无需联网。云同步或发送成品文档时才需要联网。
更佳实践:保证良好光线(日光最佳)、相机端稳并与纸面平行、确保所有文字清晰无阴影、文本密集时分段扫描。对比强的背景帮助边缘识别;对非拉丁文本手动选择正确语言能提升结果。
是。工整的分开书写——字与字分立、间距一致——识别效果接近印刷体,因为每个字都容易切分出来。清楚的连笔字也能用,但更吃力:连笔抹掉的正是识别引擎用来区分字符的空隙,所以出来的是一份草稿文字,值得回头核一遍人名和数字。潦草或匆忙写下的字衰减最快,需要逐行修正。如果你能决定东西怎么写下来,写得清楚、字字分开,转换结果最干净。
手写识别覆盖的范围比印刷体识别要窄。支持最好、最可靠的是拉丁字母的手写(英语,以及共用这套字母的西欧语言),其次是书写还算工整的西里尔字母手写,比如俄语和乌克兰语。像阿拉伯语这样的连写文字,以及手写的中文、日文、韩文,用手写就难得多;这些情况下,一笔一画写清楚、再以高分辨率拍下来,识别效果远好过随手书写。
能。把手写内容导出为可搜索 PDF:页面图像与扫描时一模一样,识别出的文字则隐形地垫在它后面,之后可以搜索、也可以复制。日记、书信、菜谱卡这类原本笔迹本身就有价值的东西,最适合这么做。如果你想要的是可以编辑的纯文字,就把识别出的文字复制到备忘录或文字处理软件,或者交给 Pages 或 Word 存成文档。