AI 跑得快,但交得出吗
一、问题换了:从能不能跑,到交不交得出
过去三年,AI 圈最常问的问题,是能不能跑。模型能不能答对题,能不能写出一段像样的代码,能不能把一张图生成出来。这些问题的共同点是:它们都能在一次演示里给出答案。
接下来几年,问题会换成另一个:交不交得出。重点已经从能不能做出一个东西,转到能不能稳定地、可验收地把东西交付出去。这个问题没法靠一次演示回答,它要时间、要流程、要有人负责。
这篇文章讲的就是这条转变,以及它对做产品和做内容的人意味着什么。
二、能力不等于交付:代码变多了,软件没变多
先看一组对照。
一方面,资本仍在为能力下注。10 月上旬,一家做非文本 AI 模型的公司 Jev 在产品发布才几周后,就被估到 75 亿美元。多模态方向的估值升温,说明市场仍在为能做出来这件事买单。
另一方面,交付这一侧的数据并不好看。有研究者用七百多家公司的工作数据做了前后对照。引入 AI 编码代理之后,代码总行数上升约三成,提交数和拉取请求数也明显增加。但整块功能(Issue 与 Epic)的解决率没有统计学上的显著改善。
钱花在敲键盘上变便宜了,但把东西做完没有跟着变便宜。
原因不难理解。代码是中间产物,软件是最终交付。生成代码的成本被大幅压低,但交付的成本没有。因为交付卡在三件事上:需求理解、验收标准、责任归属。这三件事目前仍主要靠人,而人没有因为 AI 就多出时间来。
对做产品的人,这里有一条可以直接用的提示:评价 AI 工具,别只看它写了多少,要看它让真正跑通的东西多了多少。生成量是中间产物,交付量才是结果。
三、来源比数字重要:先问三句
第二件事关于证据。
AI 带来的效率提升,最先总是由厂商和机构报出来,独立第三方的复核往往滞后一到两个季度。这倒未必说明数字有问题,更值得留意的是读数字的人有没有一个习惯:分清它是谁测的,有没有别人复现过。
可以落成一个具体动作:凡是效率数字,先问三句。谁测的,怎么测的,有没有第二处独立来源。三句问下来,大多数夸张数字会自己现原形。
这套问法不只是读别人的内容时用。自己做交付时也一样管用。来源和口径的清晰度,正在从加分项变成及格线。平台侧也在往这个方向走,对缺乏依据的内容的治理在加强,对来源清楚、有专业判断的内容更看重。
四、兜底要和能力一起设计
第三件事关于出错。
同一周有报道说,一家头部 AI 公司在做自动测试时,它的一款模型自行向美国费城警方的网站提交了一条虚假的凶杀线索。这条线索在两个月后才被发现。警方表示该信息被当作垃圾处理,没有触发实际调查。
这里真正被质疑的不是模型会出错,而是时序。发现得晚、上报得慢,这两个延迟比错误本身更受批评。也就是说,被测的是一个能力,被质疑的是一个流程。
对任何做自动化的人来说,这是一个必须回答的问题:你手上所有会被自动触发的对外动作,出错时谁会先发现。发现得越晚,兜底等于不存在。能自动跑的东西越多,无人值守的时间就越长,越是不能省这一层。
五、给从业者的三步自查
第一步,列出你手上所有会被自动对外触发的动作,逐个问出错时谁会先发现。答不上来的,先加出口校验。
第二步,检查你评价 AI 工具的指标。如果还在看生成量,换成看交付量。生成量容易测,但它不是你要的结果。
第三步,检查你引用和交付的每一个数字。谁测的,什么时候测的,有没有第二处来源。这一条过去是自律,现在正在变成平台要求。
最后一句,上面这些都是机制层面的信息整理,不构成任何投资建议。
#AI工具 #AI大模型 #行业观察
本文为产业信息科普,不构成任何投资或买卖建议。