Skip to content

多模态应用入门

过去 LLM 只吃文本,看不懂图、听不懂语音。多模态模型把图像、音频、视频也变成输入,让应用能"看"和"听":识别一张发票、理解一张图表、给视频生成字幕、审核图片是否违规。但多模态不是万能的——它贵、慢、在细节精确性上有明显边界。理解它的能力范围和成本结构,才能判断一个需求到底该不该用多模态。

多模态模型能做什么

主流多模态模型(GPT-4o、Gemini、Claude 等)能直接接收非文本输入并理解其内容:

能力典型场景
图像理解OCR、物体识别、图表解读、UI 截图还原、内容审核
音频理解语音转写、说话人区分、情感识别、会议纪要
视频理解关键帧分析、动作识别、视频字幕、违规检测
文档理解扫描件、PDF、含图表的论文结构化抽取

和纯文本模型的核心区别:纯文本模型需要你先把图 OCR 成文字、把音频转成文字,它才能处理,中间这一步错了后面全错。多模态模型跳过了这个中间表示,直接"看图说话",因此在排版复杂的文档、含图表的资料上,效果往往优于"OCR + 文本模型"的串联方案。

与纯文本应用的关键差异

维度纯文本多模态
输入体积几 KB单张图几 MB,视频更大
Token 计算按字符/词图像按分辨率切块折算,音频按时长
延迟显著更高(编码耗时)
成本高,且随分辨率/时长线性涨
可靠性文本明确细节易出错(小字、密集表格、计数)

最大坑在于 token 计算方式和成本。一张高分辨率图片,折算成 token 可能是几千甚至上万,远超一段长文本。如果不做尺寸压缩和裁剪,一次对话烧掉的成本可能超出预期一个数量级。

Token 与成本怎么算

不同厂商的折算规则不同,但思路一致:把图像切成若干 tile,每个 tile 按固定 token 计。

text
以某模型为例(近似):
  - 一张 1024x1024 图 ≈ 765 tokens
  - 一张 4K 高清图 ≈ 3000+ tokens
  - 1 分钟音频 ≈ 几百到上千 tokens
  - 1 分钟视频(抽帧)≈ 数千 tokens

务实做法:进模型前先预处理。图片按需缩放裁剪到模型最佳分辨率(通常 1024~1568 边长就够了);视频只抽关键帧而不是逐帧;音频先做 VAD 切掉静音段。这不仅省钱,也降延迟。

典型应用场景

  • OCR 与结构化抽取:发票、合同、表单转 JSON。多模态对复杂版式优于纯 OCR。
  • 图表理解:让模型读出柱状图/折线图的数值和趋势,做数据分析问答。
  • 内容审核:判断图片是否含违禁内容,作为 Guardrails 的一环。
  • 描述生成:给商品图生成营销文案、给无障碍场景生成图片描述。
  • UI 与代码:截图还原成前端代码、设计稿转页面。

对"精确计数"和"密集小字"要格外小心。模型经常数错"图里有几个人"、读错表格里的小数字。这类需求要么用专门的传统算法兜底,要么限定输入复杂度。

限制与边界

多模态模型不是"看得清一切"。它常见的失败模式:

text
- 细粒度计数:数错密集物体(人群、商品)
- 精确文字:手写体、艺术字、小字号易认错
- 空间关系:左右、前后判断有时会混乱
- 时间序列:视频里动作发生的先后顺序容易记错
- 幻觉:凭空描述图中没有的东西,且很自信

边界处理原则:能用专门的、确定性的工具解决,就不要用多模态硬扛。比如纯文字识别用 OCR 引擎更稳更便宜;人脸核身用专用模型;只有那些"需要理解语义、版式灵活、文本方案搞不定"的场景,才值得上多模态。

什么时候不该用多模态

  • 需求本质是纯文本处理(文档已经是可复制文字的 PDF),OCR 一次再喂文本模型更省。
  • 要求 100% 精确的计数或数值核对,模型概率性输出兜不住。
  • 实时性要求极高(<200ms),多模态编码延迟满足不了。
  • 成本敏感且流量大,每张图都过模型会烧钱。

务实的检查清单

  • 输入是否做过预处理(缩放、裁剪、抽帧、去静音)以控制 token 和成本?
  • 是否清楚目标模型的 token 折算规则,估过单次调用的费用?
  • 对精确性要求高的字段(数字、计数、小字)有没有传统方案兜底或人工校验?
  • 场景是否真的需要"理解语义",还是传统 OCR/CV 方案更稳更便宜?
  • 失败时是否有降级路径(识别失败 → 提示用户手动输入)?
  • 是否监控了延迟和成本,避免线上流量把账单打爆?

为复用而记录,为理解而整理。