AI 问答库
一句话回答
现阶段最落地的是「把图像里的信息变成结构化文本」:票据抽取、扫描文档版面还原、仪表与铭牌读数、门店陈列检查、图纸理解。共同点是有确定答案、能人工抽检、错了代价可控。反过来,需要精确测量、安全判定或实时控制的视觉任务,仍应交给专用视觉模型或传统机器视觉 —— 多模态强在理解语义,不强在精度和实时性。
下表按「企业内部业务系统」这个语境整理,成熟度一栏是相对判断 —— 同一类应用在标准化程度高的场景(比如固定版式的增值税发票)和混乱场景(各供应商自制的送货单)里难度差很多。挑试点场景的标准建议是:有确定答案、能抽检、错了代价可控,三个都满足的先做。
| 应用方向 | 输入 | 输出 | 成熟度与注意点 |
|---|---|---|---|
| 票据与单据字段抽取 | 发票、送货单、报销凭证的照片或扫描件 | 金额、日期、供应商、税号等结构化字段 | 较成熟;金额类字段必须人工复核 |
| 扫描文档版面还原 | 双栏排版、含表格与批注的扫描页 | 带阅读顺序与层级的结构化文本 | 较成熟;复杂表格仍需单独走表格抽取 |
| 设备仪表与铭牌读数 | 巡检拍摄的仪表盘、铭牌、状态灯照片 | 读数、型号、状态判断,写入巡检记录 | 可用;反光、脏污、拍摄角度影响大,需拍照规范 |
| 门店陈列与现场合规检查 | 货架、堆头、施工现场照片 | 是否符合规范的判断 + 问题点描述 | 可用于初筛;判定结果应交人复核,不宜直接考核 |
| 图纸与流程图理解 | 工艺流程图、接线图、示意图 | 结构化描述,供知识库检索或辅助生成 | 辅助为主;工程用途必须工程师确认后才可采用 |
| 会议与培训视频摘要 | 录制视频与同步的屏幕共享画面 | 纪要、决议清单、待办事项 | 较成熟;关键在说话人区分与术语准确性 |
两者解决的是不同层次的问题。传统机器视觉和专用检测模型强在确定性和精度:固定光源、固定工位、固定判定标准下,检测一个零件有没有划痕、尺寸是否超差,能做到稳定且极快,还能给出可复现的量化指标。多模态大模型强在语义理解和泛化:它能读懂一张没见过版式的单据在说什么,能理解一张流程图的逻辑关系,能回答「这张现场照片里有什么不符合规范的地方」。所以正确的分工是:需要精确数值、需要毫秒级响应、需要百分百可复现的,用专用方案;需要理解内容、需要适应变化的版式和场景、需要输出自然语言解释的,用多模态。两者也可以串起来 —— 专用模型负责检出,多模态负责解释和归类。
一是成本。图像会被切成大量视觉 token,一张高分辨率图的开销可能相当于几千字文本,批量处理几万张单据的账要提前算清楚。常见的优化是先按需求压缩分辨率、裁剪出关键区域,再送模型。二是输入质量。多模态模型对拍摄条件比人想象中敏感 —— 反光、遮挡、倾斜、过曝都会显著影响结果。与其反复调提示词,不如先制定拍照规范并在采集端做校验,这通常是投入产出比最高的一步。三是评测与兜底。要建一批带标准答案的真实图片作为评测集,按场景分层统计准确情况;同时设计明确的降级路径 —— 模型识别置信度低或字段缺失时转人工,而不是让它硬猜一个值填进业务系统。
适用边界
同义问法