先把多模态拆开看
多模态不是一个东西,至少要分「理解」和「生成」两大类,落地难度完全不同。
理解类已经相当成熟:图片理解(GPT-4o、Claude、通义千问都能看图答题、读图表、识别 UI 截图)、语音转文字(Whisper 之后基本是免费能力)、文档解析(拍发票、读合同)。这类能力的特点是「错了人好兜底」——识别错了用户一眼能看出来,改一下就行,所以渗透最快。豆包的拍照答疑、微信读书的 AI 朗读、各种扫描类 App 都靠这个。
生成类就分层了。文生图(Midjourney、即梦、SD 系列)在营销素材、电商图这类「好看就行、错了没人较真」的场景已经商用;语音合成(TTS)在有声书、客服里成熟可用;文生视频(Sora、可灵、Vidu)效果惊艳但还停留在「内容创作者尝鲜」阶段,离稳定的生产力工具差一口气。
这里有个容易踩的坑:把「理解」和「生成」混为一谈去评估。比如「AI 看图生成商品详情页」,看图是理解、出详情页文案和排版是生成,两段能力要分开测,锅也要分开背——图读错了是理解的问题,文案写差了是生成的问题,混在一起调优会互相甩锅。
落地难点一:成本
这是最容易被低估的。一张图进模型,按常见分辨率折算大约几百到一千多 token,一次带图问答的成本是纯文本的好几倍;一段 1 分钟的语音转写加理解,成本是一次文字对话的几十倍;视频更夸张,理解视频要抽帧,一分钟视频抽几十帧,每帧都是钱。可灵生成一条 5 秒视频的成本折算下来是几块钱人民币量级,用户愿意为「好玩」付一次钱,不会为「日常」付一百次钱。所以多模态产品的定价模型和用户心理账户怎么匹配,是 PM 要算的的第一笔账。
落地难点二:延迟和交互形态
文本对话用户能接受 3 秒出第一个字,语音对话的及格线是端到端 1 秒以内,优秀线 300-500 毫秒——这是真人对谈的停顿感受。GPT-4o 的实时语音之所以是里程碑,就是把「语音转文字→LLM→文字转语音」的三段式 pipeline(延迟动辄两三秒)换成了端到端,但这类实时 API 的价格和稳定性目前撑不起大规模 C 端免费产品。PM 设计语音功能时要诚实:如果你的场景做不到 1 秒内响应,就别做成「打断式自由对话」,做成按住说话、松开发送的半双工,预期管理好了体验反而好。
落地难点三:准确率的天花板场景
理解类能力在「清晰、标准」的输入上很好,一到真实世界就打折:手写体、模糊照片、方言口音、嘈杂环境、专业图表。OCR 识别打印发票准确率能到 98% 以上,识别医生手写处方可能掉到不能用的水平。所以多模态产品的场景选择原则是:挑「容错高」的场景切——配图生成、拍照翻译、内容审核辅助,避开「错一个数字就出事」的场景(医疗影像诊断、合同金额提取全自动入账),或者后者必须配人工复核环节,把 AI 定位成「初筛」而不是「终审」。
给 PM 的判断框架
评估一个多模态需求,我问三个问题:一,输入是不是天然就多模态(用户本来就在拍照、说话),还是为了用技术硬造的场景?二,错了用户能不能低成本发现和纠正?三,单次的增量成本相对用户愿不愿意为这个功能付的钱,是不是打得住?三个问题里有两个答不上来,这个功能大概率是发布会功能,不是产品功能。
补一个正向例子收尾:教育场景几乎全过这三问——学生本来就在拍题(天然输入)、答案错了对照解析能发现(可纠正)、家长为讲题付费的意愿明确(心理账户存在)。所以拍照搜题、口语陪练是多模态渗透最深的赛道之一。反过来,「语音控制所有 App」这种设想卡在第二问:误操作的发现和纠正成本太高,喊了多年也没成主流。