Artifact 002 Thinking

AI 场景值不值得做,大半不是 AI 的事

大半标准不是 AI 教的,是产品本来就该算的账。别让热闹冲掉它,别低估 AI 的成本,也别把它用错地方。

“这个,用 AI 解决一下。” “这个可以做个 Skill。” “这个建议你自己用 AI 动手解决,不用提需求了。”

作为产品打工人,这两年我经常听到这些话,甚至我自己也跟合作方、跟团队这么说过。不能说不对,但有时候确实一头雾水。数据报表、客服、数据清洗,好像什么都能往 AI 上靠。一开始我也跟着兴奋,自己也没少试。

后来慢慢发现,大多数尝试停在一篇 PR 稿,或者“做了个 demo,但没人用”。

这些话很难反驳,毕竟 AI 时代倡导 AI First,你也没法每一件事都回一句“这个不合适”。所以我慢慢给自己攒了一套判断的标准,一共四条。它让我在这阵热闹里心里有数,也不把这份 AI 焦虑传给身边的人。

而且这套标准不只在那个场景用。你立项一个 AI 产品,要用它;你当管理者判断方向,要用它;你去面试一家 AI 公司,它给你讲了一个很性感的故事,你也要用它。都是同一套账。

这套账,大半不是我发明的——它是产品本来就该算的账,只是 AI 时代,特别容易把它忘掉。

旧范式真扛不住,才值得换

立项会上最常听到的一句话是:“这个方向,我们可以 AI 化。”

这种话没人会当面追着问“旧范式哪里扛不住了”——那是把会问死。但我自己会在心里把这笔账过一遍。多数时候,大家说的“扛不住”是“现在太慢了”“人不够用”,这都还没到点上。

旧方案可以有一百个缺点,只要缺点是能修出来的,就不值得换范式。加人、改流程、补规则,都是办法。真正值得换的,是瓶颈结构性卡住:不换,就解不了。

这种卡没卡住,我一般看三点。先说一句:这套账,第一条比的是“替代旧供给”——B 端的活大多属于这类,例子顺手都取自这边。还有一种场景没有旧供给,AI 替代的是用户自己动手,这条的比法不一样,回头单独说。

  • 规模×复杂度超过线性扩展的边界。 画一条旧方案的成本曲线:业务量翻 10 倍,人力也跟着翻 10 倍,甚至更多,那大概率这个业务的边际成本不会递减。客服、审核、尽调这类人力密集的活最典型——业务按乘法涨,人力只能按加法补,每涨一倍就多招一批人,招不到、培训跟不上、管理复杂度先爆掉。这种墙是结构性的,不是哪个环节不行,是组织形态扛不住这个量级。加人能跟上的增长,只是普通的忙。
  • 时间敏感,且压缩时间的代价付得起。 旧范式往往不是“做不到”,是“做不快”。判责理赔就是典型:收集证据、人工判断,天然要时间,大家都知道,越快处理完,用户体验越好。但时间不是免费的:快,要么堆人力(贵),要么接受赔付(被薅)。淘宝 88VIP 极速无理由退款,从另一个视角构建体验上的差异——整个生态里,一头体验好,另一头就必然有环节在承担成本。真正要算的,是快带来的体验增量,整体代价付不付得起、用什么方式控住。
  • 长尾存在系统性风险。 低频错误频率 × 单次错误代价 × 业务规模,乘出来的敞口大到不能接受。合规、法务、资金这类场景尤其典型:旧范式靠人海复核压错误率,但漏一个就是事故,错误率永远压不到零。不是所有低频错误都致命——不碰红线、可逆、可补救的,人盯一盯就行;真正致命的,是一次事故吃掉全年收益,那就该机器兜底。风控和合规会帮你算这笔账。

三点都不中,说明旧范式还撑得住,AI 不是必需品。规则引擎、搜索优化、流程再造,旧流程还有很大的空间。很多“用 AI 解决一下”的需求,其实是旧流程还没理顺,只是顺手把 AI 挂了上去。

但也不是一票否决——AI 能带来突破,当然好;突破有限的话,就得算三笔:AI 的突破是增量,旧流程继续迭代也有成本,AI 引进来还带着组织熵增——新团队、新流程、跨部门的磨合,都是隐性开销。这三笔放在一起,是继续磨旧流程,还是值得上 AI,得根据情况定。

这一步,其实跟 AI 没什么关系。判断任何一个新方案,都是先问旧方案哪里卡住了。

这套账的第一条,默认是拿旧供给当尺子。有一种场景没有这把尺子:AI 替代的不是哪个旧方案,是你自己动手做这件事,旧范式这条就比不了,换成问:多少人因为做这件事的认知成本太高,干脆不做了。

省掉的劳动,要远大于新增的成本

我做过一个 AI 改造,上线后用户说:“还是原来那个按钮好用。”我一开始觉得是用户不习惯,后来发现不是——我替用户省了两次点击,但让用户多了三句话要描述需求。省了 30 秒,花了 1 分钟,这笔账怎么算都是亏的。

俞军老师的 VNOS,讲的是新体验、旧体验和迁移成本:新东西再好,用户也不会因为“更好”就换,他要的是净赚得足够多,而净赚要扣掉换过去的成本。AI 省掉的劳动,是旧体验和新体验的差值;新增的摩擦,是迁移成本。

问题是 AI 时代这笔账特别容易算错,因为成本被低估了。传统交互的成本是一次可见的,点一下按钮,付出就付出了。AI 是对话式的,成本散在多轮里——每一轮,用户都要组织语言、等生成、读一遍、发现不对、重新说。这些是隐性累加的,用户自己都要等到“怎么这么累”才意识到。

所以算这笔账,不能按理想单轮算,要按真实多轮算。

另外,“省掉的劳动”本身,也特别容易被高估。最典型的就是标准化场景里找 AI:千问做过点奶茶,美团小美 AI 助手首发功能也是点咖啡——都在极度标准化的交易品类里用 AI 追极致效率,从实现成本和产品发布的角度看,做得都不错。

但要落到用户价值上,大部分普通用户不是绝对效率导向:点一杯 Manner,打开 app、搜索、下单、选优惠,很快;也许搜索的时候正好看到一家新店,就不点 Manner 了。标准化场景里,现在的导购和交易体验已经够好,AI 省下的那点劳动,构建不起来持续使用的心智。

我反而觉得真正有空间的,是另一面:极度非标、交易摩擦很大的品类——现在的产品形态,还没好好满足这类需求。

“省掉的劳动”被高估,还有一层——省掉的不一定是负担:爱做攻略的人,享受的正是攻略本身。

做旅行攻略就是例子。爱做规划、甚至事无巨细的人,很多是在享受规划本身:旅行体验不是从出门那一刻才开始的,你决定要去的那天就开始了——查攻略、排行程、做准备,都是乐趣。

他们要的不是“替我做规划”,是细节:陌生国家的地铁票怎么买、景点之间公交怎么换乘、末班车是几点、餐厅要不要提前约。替他们省掉规划,不是减负,是剥夺乐趣。真正被“太麻烦了不去了”劝退、被认知成本挡住的那拨人,才值得替。

这个判断不只在用户端成立,B 端也一样——省掉的劳动是爽还是痛,看的是做它的人,不分什么端。

这两年大家普遍跳过这笔账,多半是因为热闹。在“什么都能做”的氛围里,新体验的想象力太满了,满到没人想起来还有迁移成本这一项。可恰恰是这一项,让很多产品、团队、打工人都坚持不下去。

这一步,其实跟 AI 也没什么关系。判断任何一个新方案,还是先问:这笔账,算不算得过来?

团队得有能力定义“好”

传统软件里“什么是好”是确定的:功能跑通了,就是好,AB 实验做正了就是好。AI 产品不一样,同一个输入,合法输出有无数种,“好”是一个分布,得有人把它定义出来。而能不能定义出来,不是技术问题,是组织问题。

我们在履约判责场景里遇过:劳动者上门后不履约,产品和运营对同一批 case 的判法都不一样。连人都说不清什么是对的 case,AI 去学一个连人都没统一的判断标准,学出来的一定是它自己的“平均”——而那个平均,谁都不认。

  • 领域专家在不在。 有没有资深业务的人全职参与定标准。能找到人但只能兼职,是黄灯;没有一个人同时懂业务细节和整体逻辑,是红灯。
  • 标准共识度。 两个专家独立判断同一批 case,一致性 >85% 是绿灯,65-85% 黄灯,低于 65% 红灯——人类自己都说不清什么是对。
  • 标准稳不稳。 至少半年内不会大幅变化。每季度都在变是黄灯,现在还没成型是红灯。

红灯就先别做 AI,先做一件更便宜的事:把最资深的几个人的判断逻辑写下来。这件事本身就有价值,哪怕最后不用 AI。把“什么是好”显式化,是组织能力,不只是项目的准备。

这一步,确实是 AI 新增的部分——前面几笔账,以前做产品也算过;只有“怎么定义好”,是 AI 才逼着我们回答的。

“更好”的标准要提前立住

最常栽的跟头是:A/B 结果出来了,老板问“这算成功吗”,你才发现“成功”这个词,在项目开始的时候从来没人定义过。这时候再争,什么都说服不了谁。

所以“好”要在立项那天就定下来,不是等结果出来再争。但先得承认:AI 的“好”,本来就不容易说清。传统功能上线,看指标动不动就行;AI 不一样,同一个输入,合法输出有无数种,你没法说它“做对了”,只能说它在质量分布上站到了哪个位置——准确性、幻觉率、基准对比,一句话,“好”要能被度量到百分点。

而度量哪些维度,没有通用答案,得按项目来。能通用的不是哪张表,是这件事本身:立项那天,和决策层一起把“怎么算好”写下来,任何一个维度不达标,都有对应的处理策略,而不是临时解释。它也是你“讲好这个 AI 故事”的底牌。

故事不是吹出来的,是项目开始那天就写好了验收标准。

AI SCENE GATE 门禁画板:不是所有场景都该上 AI,先过这四道门。01 旧范式扛不住——瓶颈结构性卡住才值得换范式;02 省掉的劳动——别拿理想单轮算账,省掉的劳动还可能是享受,不是负担;03 团队定义好——领域专家全职、两个专家独立判断一致超过85%、标准半年内稳得住,才算绿灯;04 标准提前立住——立项那天和决策层写下怎么算好,任何维度不达标都有处理策略。每道门答不过,就先停在门口。

这套标准,算的是“值不值得做出结果”。拿着它,你大概率能判断出:这个项目,值不值。

不过有时候,结果本身不重要,站在热闹里,不内耗,顺着环境来,也很精彩。但无论如何要做心里有数:这是真的,还是气氛。

至于这套框架自己,也在过期——前两年判断“值不值得做”,看能不能算得过账;这两年 AI 涨得太快,有些账今天算不过,明年可能就过了。判断标准本身,也得跟着改,这大概才是常态。