多模态应用入门
过去 LLM 只吃文本,看不懂图、听不懂语音。多模态模型把图像、音频、视频也变成输入,让应用能"看"和"听":识别一张发票、理解一张图表、给视频生成字幕、审核图片是否违规。但多模态不是万能的——它贵、慢、在细节精确性上有明显边界。理解它的能力范围和成本结构,才能判断一个需求到底该不该用多模态。
多模态模型能做什么
主流多模态模型(GPT-4o、Gemini、Claude 等)能直接接收非文本输入并理解其内容:
| 能力 | 典型场景 |
|---|---|
| 图像理解 | OCR、物体识别、图表解读、UI 截图还原、内容审核 |
| 音频理解 | 语音转写、说话人区分、情感识别、会议纪要 |
| 视频理解 | 关键帧分析、动作识别、视频字幕、违规检测 |
| 文档理解 | 扫描件、PDF、含图表的论文结构化抽取 |
和纯文本模型的核心区别:纯文本模型需要你先把图 OCR 成文字、把音频转成文字,它才能处理,中间这一步错了后面全错。多模态模型跳过了这个中间表示,直接"看图说话",因此在排版复杂的文档、含图表的资料上,效果往往优于"OCR + 文本模型"的串联方案。
与纯文本应用的关键差异
| 维度 | 纯文本 | 多模态 |
|---|---|---|
| 输入体积 | 几 KB | 单张图几 MB,视频更大 |
| Token 计算 | 按字符/词 | 图像按分辨率切块折算,音频按时长 |
| 延迟 | 低 | 显著更高(编码耗时) |
| 成本 | 低 | 高,且随分辨率/时长线性涨 |
| 可靠性 | 文本明确 | 细节易出错(小字、密集表格、计数) |
最大坑在于 token 计算方式和成本。一张高分辨率图片,折算成 token 可能是几千甚至上万,远超一段长文本。如果不做尺寸压缩和裁剪,一次对话烧掉的成本可能超出预期一个数量级。
Token 与成本怎么算
不同厂商的折算规则不同,但思路一致:把图像切成若干 tile,每个 tile 按固定 token 计。
text
以某模型为例(近似):
- 一张 1024x1024 图 ≈ 765 tokens
- 一张 4K 高清图 ≈ 3000+ tokens
- 1 分钟音频 ≈ 几百到上千 tokens
- 1 分钟视频(抽帧)≈ 数千 tokens务实做法:进模型前先预处理。图片按需缩放裁剪到模型最佳分辨率(通常 1024~1568 边长就够了);视频只抽关键帧而不是逐帧;音频先做 VAD 切掉静音段。这不仅省钱,也降延迟。
典型应用场景
- OCR 与结构化抽取:发票、合同、表单转 JSON。多模态对复杂版式优于纯 OCR。
- 图表理解:让模型读出柱状图/折线图的数值和趋势,做数据分析问答。
- 内容审核:判断图片是否含违禁内容,作为 Guardrails 的一环。
- 描述生成:给商品图生成营销文案、给无障碍场景生成图片描述。
- UI 与代码:截图还原成前端代码、设计稿转页面。
对"精确计数"和"密集小字"要格外小心。模型经常数错"图里有几个人"、读错表格里的小数字。这类需求要么用专门的传统算法兜底,要么限定输入复杂度。
限制与边界
多模态模型不是"看得清一切"。它常见的失败模式:
text
- 细粒度计数:数错密集物体(人群、商品)
- 精确文字:手写体、艺术字、小字号易认错
- 空间关系:左右、前后判断有时会混乱
- 时间序列:视频里动作发生的先后顺序容易记错
- 幻觉:凭空描述图中没有的东西,且很自信边界处理原则:能用专门的、确定性的工具解决,就不要用多模态硬扛。比如纯文字识别用 OCR 引擎更稳更便宜;人脸核身用专用模型;只有那些"需要理解语义、版式灵活、文本方案搞不定"的场景,才值得上多模态。
什么时候不该用多模态
- 需求本质是纯文本处理(文档已经是可复制文字的 PDF),OCR 一次再喂文本模型更省。
- 要求 100% 精确的计数或数值核对,模型概率性输出兜不住。
- 实时性要求极高(<200ms),多模态编码延迟满足不了。
- 成本敏感且流量大,每张图都过模型会烧钱。
务实的检查清单
- 输入是否做过预处理(缩放、裁剪、抽帧、去静音)以控制 token 和成本?
- 是否清楚目标模型的 token 折算规则,估过单次调用的费用?
- 对精确性要求高的字段(数字、计数、小字)有没有传统方案兜底或人工校验?
- 场景是否真的需要"理解语义",还是传统 OCR/CV 方案更稳更便宜?
- 失败时是否有降级路径(识别失败 → 提示用户手动输入)?
- 是否监控了延迟和成本,避免线上流量把账单打爆?