把图片或扫描件里的文字识别成可处理文本的技术。
它像考试后借学霸笔记誊答案的人:先盯着那页歪歪扭扭的字,硬是把图上的字认出来,再交给电脑接着处理。
常用于票据录入、合同整理和截图取字,是文档自动化起点。
Computer Vision它是计算机视觉里最经典的落地任务之一。
Document parsing文档解析常先靠它识字,再做结构化提取。
Multimodal它把图里的字变成文本,方便多模态模型理解。
Ai-file-upload用户上传图片或 PDF 后,常先用它提取文字。