BLOG

大模型一周四更,企业“模型疲劳”了:跟,还是躺?

Kael Zhang
AILLMEnterprise
广告 · Advertisement

开场:媒体造了个新词——“模型疲劳”

过去一周,大模型市场迎来一轮密集”上新潮”:9 月 1 日 Anthropic 一口气更新两款模型,9 月 2 日 Meta 和谷歌同日发布,9 月 3 日 OpenAI 端出 GPT-6 Astra——一周之内,四家巨头连发。

观察者网报道这件事的时候,用了一个新词:模型疲劳(model fatigue)。不是用户对 AI 失去兴趣,而是新模型发布得太快,开发者、企业客户、投资者都疲于应对——一个模型还没评估完,下一个版本已经发布了;刚完成部署,可能马上又面临升级。

有个数字很能说明问题:主要模型的发布间隔中位数,已经从 2023 年的 37.5 天,缩短到如今的 11 天。

我把这篇报道和背后的行业逻辑捋了一遍,然后把问题抛给了 17 年软件从业、7 年 AI 从业经验、现任 AI 技术总监的永亮——他亲手做过企业级 AI 提效方案,“模型选型”正是他的日常。

拾闻:一周四更,连你们这种专业选手都跟不上节奏了,什么感觉? 永亮:说实话,我已经不追了。不是躺平,是想明白了一件事:追模型是个无限游戏,企业赢不了,也不用赢。 拾闻:行,那咱们就聊透:为什么这么快、企业到底在愁什么、怎么办。


Q1:“周更”到底有多密?“模型疲劳”疲在哪?

永亮:把时间线摆出来,你就知道有多疯。

9 月 1 日,Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,后者自称”世界上最先进的编码和知识工作模型”。9 月 2 日,Meta 发布 Muse Spark 1.3,谷歌发布 Gemini 3.8 Flash。9 月 3 日,OpenAI 发布 GPT-6 Astra,自称”全球最智能、对齐最好的模型”。同一天,阿联酋的 MBZUAI 还开源了 K2 Horizon 系列。

一周,五波。而且这不是偶发——谷歌在 106 天里 4 次更新 Gemini Flash,最新一代距上一代只隔了 3 周。OpenAI 自己的发布间隔中位数,从 2023 年的 170 天压到了今年的 49 天。

“疲劳”疲在哪?观察者网采访的几位从业者的原话很真实。Runpod 的 CEO 说”模型疲劳真实存在”,Clockwork Systems 的 CEO 说得更狠:每次发布都”好得离谱”,以至于很难判断什么才算真正的跨越式进步——听起来都好,那到底选哪个?

对企业来说这是实打实的成本:每出一个新模型,你要重新评估性能、价格、算力需求、安全性、API 兼容性、和现有业务的适配度。原来这套流程一年做一两次,现在一个季度做四五次。报道里那个细节最扎心:一家企业要评估 10 个候选模型,最后只能挑 5 个做——没资源全评。 中小企业更惨,可能连 5 个都评不完。

Q2:厂商为什么疯了一样发?

永亮:三个动力叠加,每个都不允许它慢。

第一,资本市场的指挥棒。 Anthropic 和 OpenAI 都在备战上市,私人估值都接近 1 万亿美元。这个估值叙事需要什么?需要”持续的增长故事”。持续发新模型,就是最直接的”我们还在领跑”的信号。发得慢一个季度,估值故事就断一截。

第二,“能力趋同”的囚徒困境。 Gartner 今年 6 月提了个概念叫 capability convergence——当越来越多模型在基准测试上表现趋近,你”率先发布”建立的优势,短时间内就会被别人抹平。这导致一个恶性循环:优势保持期越短,越要靠发布频率来维持存在感。 大家不是想发这么快,是不发就等于退场。

第三,中国厂商的追赶改变了牌局。 报道里提到,月之暗面、智谱这些中国企业的开放权重模型,性能已经逼近甚至部分达到闭源水平,而成本和开放度全面占优。21 财经那篇报道的数据更狠:美企调用中国模型的 token 占比,从 2025 年上半年的 4.5% 涨到今年 2 月后的 30% 以上;同样的工作量,Claude 收 25 美元的活,DeepSeek 只要 0.18 美元。当性价比差一百倍,硅谷巨头只能用”更新更快”来对冲”更贵”。

所以你看,这是一场没有人敢踩刹车的竞速。OpenAI 的 CEO 奥尔特曼自己都承认,整个行业都在”加快步伐”。

Q3:企业到底在愁什么?这笔账怎么算?

永亮:愁的不是模型不好,是”好”变得太便宜了。

我给企业做过 AI 方案,这笔账我算过很多遍。表面上看,模型越来越强、越来越便宜,是好事。但对选型的人来说,这意味着三件事:

第一,评估成本变成了持续性开销。 以前选型是一次性项目,现在变成了常态工作。评测集要维护、测试要跑、结果要对比——这套东西每来一个新模型就得转一遍。很多公司的 AI 团队,一半时间在”追更”,一半时间在”后悔”。

第二,绑定的风险变大了。 你把业务深度绑在某家模型的特性上,它下个月出一个新版本,行为变了,你的应用可能就出问题。模型越更新快,“锁定一家”的风险越高——但”每家都接”的维护成本又摆在那。

第三,FOMO 变成了决策瘫痪。 团队里永远有人在问”XX 出新版了要不要换”。换了,要重新测试重新适配;不换,心里不踏实。这种反复拉扯消耗的信任和士气,比技术成本更伤。

报道里 Gartner 的判断,其实是给所有企业提了个醒:基础模型的优势正在变成暂时性的。 翻译成大白话:指望”选对一个模型”就一劳永逸,这个时代结束了。

Q4:跟还是躺?说说你的”以不变应万变”

永亮:都不对。正确答案是:把”追模型”变成架构问题,而不是人力问题。

我做企业 AI 方案时定过一条铁律:任何业务都不直接依赖任何一家模型的版本号。 具体三层:

第一层,模型网关。 所有调用走统一网关,下面接多家模型。业务代码只认接口,不认模型。换模型是改一行配置,不是改一个月代码。这样”模型周更”对你的影响,就从”项目级”降到了”配置级”。

第二层,评估自动化。 别靠人的感觉判断”新模型好不好”,建一套自己的评测集——拿你真实业务的输入输出做基准,新模型来了,跑一遍自动化评测,出分数、出对比。这套东西建一次,受益每一次。你的评测集,比任何第三方榜单都准,因为它是拿你自己的业务喂出来的。

第三层,价值下沉。 这是最重要的。Gartner 说价值向下游转移——数据质量、集成深度、领域微调。这跟我做方案的经验完全一致:真正构成壁垒的,从来不是你用了哪个模型,而是你沉淀的数据、你打通的流程、你调教出的领域适配。 模型是租来的能力,数据和流程才是自己的资产。

一句话总结:跟,永远跟不完;躺,很快就出局。唯一可持续的打法,是让”换模型”这件事变得便宜。

Q5:Gartner 说价值向下游转移——普通人和企业该往哪积累?

永亮:三层积累,按”模型换不走”的程度排序。

第一,数据。 你的业务数据、用户反馈、领域知识库——这些是模型永远带不走的。企业现在最该做的,是把散落在各部门的数据治理好、结构化、可检索。模型再强,喂不到你的数据,对你就没用。

第二,流程与集成。 AI 怎么嵌进你的业务流程、谁审核、出问题怎么兜底——这套”集成深度”是第二个护城河。这也是为什么我总说企业 AI 提效不是买工具,是把流程改对。

第三,判断力。 对个人来说,“会用某个模型”的保质期只有几周,“能判断 AI 输出好不好”的保质期是整个职业生涯。模型 11 天一更新,你追模型永远追不过;但判断什么该用 AI、什么不该信、出了错怎么办——这个能力,模型越强越值钱。

回到最初的问题:模型疲劳怎么办?我的答案已经给出来了——别把公司绑在一个模型的版本号上,要把价值沉到模型换得走的地方。 厂商在跑无限游戏,你只要守好自己的护城河,让它们替你卷。


尾声

拾闻:最后,用一句话总结这期? 永亮:厂商卷模型,你卷数据和流程——模型是租的,护城河才是自己的。 拾闻:这句话,送给大家。下期见。


【技术纵深】“模型网关 + 评测集”到底长什么样?

这期反复说”把追模型变成架构问题”,那这套东西的技术形态,值得展开讲讲。

模型网关(AI Gateway),本质是一个反向代理:业务方统一调网关的 API,网关负责路由到 OpenAI/Anthropic/DeepSeek/本地模型,顺带做密钥管理、用量统计、限流、故障切换。开源方案里 LiteLLM、OneAPI 这类已经很成熟,云厂商也有托管版。它的价值在”周更时代”被急剧放大:模型层的变动被网关吸收,业务层无感。 某家模型挂了或作妖,切流量就是改配置。

评测集(Eval Set),是你自己业务的一组”标准考题”:真实输入 + 期望输出的判断标准。新模型来了,把考题跑一遍,自动打分对比。关键在”真实业务”四个字——第三方榜单测的是通用能力,你的评测集测的是”在你这个场景下行不行”。一个做医疗问答的系统和一个写营销文案的系统,“好”的定义完全不同,通用榜单没法替你回答。评测集不用大,几十到几百条高质量样本就够用,难点不在量,在于把”什么是好输出”写成机器可判的规则。

这两个东西合起来,构成企业在”模型周更时代”的稳定器:网关管”换得快”,评测集管”换得对”。再加上把提示词、业务规则、领域知识外置成版本化资产(而不是散在代码里),你的 AI 系统就从”绑在某版模型上的应用”,变成了”任何模型都能插的底盘”。

这也是”模型疲劳”的终极解药:不是追上所有模型,而是让”不追”的成本变得可承受。

广告 · Advertisement