AI 产品设计边界
传统软件是确定性的:点同一个按钮,得到同一个结果。AI 产品不是——同样的输入,模型可能给出不同的、甚至错误的回答。这种不确定性是 AI 产品的根本约束,所有产品设计决策都围绕它展开:如何向用户传达"这可能不准"、如何在它失败时优雅降级、什么时候该让人介入、以及最关键的——哪些场景根本不该用 AI。把 AI 当万能锤子,是产品翻车的开始。
先接受:AI 不能 100% 可靠
这是设计 AI 产品的第一原则。模型会幻觉、会跑题、会在不该自信的地方很自信。如果产品假装它"永远对",用户照着错的结果操作,损失就发生了。
| 信任度 | 设计取向 |
|---|---|
| 高可靠要求(医疗诊断、法律结论) | AI 仅辅助,最终必须人工确认 |
| 中等(写作助手、摘要、推荐) | AI 主导,用户可改,标注"AI 生成" |
| 容错(娱乐、灵感、草稿) | AI 全自动,失败成本低 |
产品设计的核心问题不是"模型能做到吗",而是"它错了的代价我承受得起吗"。承受不起的,就必须加人工关卡或确定性兜底。
人机协作 vs 全自动
| 模式 | 适用 | 体验 |
|---|---|---|
| 全自动 | 失败成本低、可批量、可重做 | 快,但出错用户没机会拦 |
| 人审后执行 | 高风险、不可逆动作 | 稳,但有延迟和人力成本 |
| AI 草稿 + 人编辑 | 创作类、内容生成 | 平衡,保留人的最终控制权 |
| Copilot 协助 | 专业工具、代码、办公 | 人主导,AI 加速,可控性最高 |
一个务实的经验:默认偏向人机协作。让 AI 干"费时但不致命"的活(草拟、抽取、初筛),让人干"判断和拍板"的活。全自动只放在那些"错了也能轻易撤销"的场景。
延迟与体验
AI 调用慢,一次几秒到几十秒是常态。这对用户体验是巨大挑战:
text
传统接口:200ms 内返回,用户感知"即时"
AI 接口:3-15s 才返回,用户感知"卡住了"应对手段:
- 流式输出(streaming):边生成边返回,让用户看到"在动",体感延迟大幅下降。
- 分阶段反馈:先回一句"正在思考",再给结果,避免黑屏等待。
- 预生成与缓存:高频问题可预计算或缓存,命中即秒回。
- 异步任务:超长任务(报告生成、视频处理)改成后台跑 + 完成通知。
延迟不只是技术指标,是产品体验的一部分。同样的准确率,流式 + 实时反馈的版本,用户满意度会高一大截。
失败要优雅降级
模型会失败,关键是失败时不要把烂摊子甩给用户。降级链路:
text
模型超时/出错
→ 重试(有限次)
→ 仍失败 → 返回兜底文案 + 引导用户重试或转人工
→ 绝不返回半截错误堆栈或"我不知道"就结束兜底要设计得像产品的一部分,而不是系统报错。"这个问题我暂时答不了,已转给人工,预计 X 分钟回复"远好过 500 Internal Server Error。
用户预期管理
AI 产品最容易翻车的地方,是承诺了做不到的事。文案、引导、示例都在塑造用户预期:
| 做法 | 效果 |
|---|---|
| 标注"AI 生成,请核对" | 降低用户对绝对正确的期待 |
| 给出引用/来源 | 让用户能自行核验,建立信任 |
| 展示能力边界示例 | 让用户知道"它能干什么、不能干什么" |
| 失败时不掩饰 | 坦诚说"没找到",比硬编一个错答案好 |
用户对 AI 的信任是消耗品。一次 confident 的错误回答,会毁掉十次正确回答积累的信任。宁可保守,不要吹。
反馈闭环
AI 产品必须有用户反馈通道,而且要闭环用起来:
text
用户点"回答没用/有错"
→ 记录 bad case
→ 进入评测集和护栏优化
→ 下一版针对性改进
→ 改进效果通过评测验证没有闭环,反馈按钮就是装饰。真正有用的产品,会把"用户点了踩"的 case 当作最高优先级的改进信号,而不是一个埋点数据。
什么时候不该用 AI
这是设计师最该想清楚的问题。AI 不是默认选项,它有明确的适用边界:
- 规则明确、需要 100% 准确:用传统代码,别上模型。算账、权限、库存这种,错了出事。
- 流量大、成本敏感:每次调用都要钱,规模上来账单可能失控。
- 延迟要求极高:实时交互 <200ms 的场景,模型跟不上。
- 可解释性要求强:监管要求每个决策可审计、可解释,黑盒模型难满足。
- 用户期待确定性:同样的操作必须得到同样结果,模型的波动会让用户困惑。
判断标准很简单:如果一个确定性的规则或传统算法能解决,就先用它;只有当问题本质上是"模糊的、语义的、需要泛化的",才考虑 AI。
务实的检查清单
- 产品是否坦诚传达了"AI 可能不准",还是假装它永远对?
- 失败时是否有优雅降级,而不是甩给用户一个报错?
- 高风险动作是否有人工关卡或确定性兜底?
- 延迟是否用流式/反馈手段缓解,体感是否可接受?
- 用户反馈是否形成闭环,bad case 能否驱动改进?
- 这个场景真的需要 AI 吗,还是传统方案更稳更便宜?