新智元报道
新智元报道

突然,Anthropic 拔网线了!
刚刚,AI圈发生了一件堪称「午夜惊魂」的大事件:Anthropic 直接拔掉了新一代 Opus(内部代号 Opus-Next)的灰度测试网线!
之后,一天之内 Opus-Next 又回来了。
Opus 5.2 这次说不准马上就来了。

当然,也有可能只是测试新的版本。

此前,Anthropic一直暗搓搓地在搞「偷梁换柱」的把戏——他们通过隐式路由(Stealth Routing),把一部分原本指向 Opus 5 的请求,悄悄重定向到了尚未发布的新一代巨无霸模型 Opus-Next 上。
我们先来看一个真实的「惨案」。
硬核独立游戏开发者、网友Leo,成为了这次事件中最生动的「受害者」代表。
几个小时前,他还在社交媒体上兴奋地直播自己如何利用 Claude 极速开发一款复杂的独立游戏。

据他描述,Anthropic连夜拔网线,活跃测试账号直接归零,没有任何提前通知,没有任何缓冲期。

新模型测试全面停摆,留下一地鸡毛,和无数在风中凌乱的开发者。
不过,作为一名极客,他在痛心疾首之余也展现出了极高的职业素养。
好消息是,没多久Opus-Next又回来了,甚至灰度测试范围还从Claude Code扩大了Claude Chat/Cowork/Code。
他又乐观起来了:
这是个好兆头,预示着新模型即将发布或新版本正在测试。

测试方法也很简单,选中Opus 5,低effort,关闭搜索,然后输出:
do you know who is 『tibo』 the reset guy don’t search
如果不打开搜索,你知道谁是「重置哥Tibo」吗?
如果,能答对「重置哥 Tibo / Thibault Sottiaux」, 那恭喜你命中了灰度测试;如果Opus一脸茫然,那就还是老Opus 5。

据深度分析,这是一场精心策划的隐式路由灰度测试(Stealth Routing A/B Test)。
在过去的几周里,Anthropic 在API 路由网关层植入了一个概率极低的「暗门」。Anthropic 玩的就是这一手。
当开发者调用目前的旗舰模型 Opus 5 时,系统会根据复杂的规则,将极少部分请求在后端静默重定向(Redirect)到内部代号为 Opus-Next 的未发布模型上。

对于开发者来说,前端返回的模型名称依然不变,但内在能力直接跃升一大截。
他们为什么要这么做?
答案很简单:高质量的野生测试数据。
在实验室里闭门造车,永远无法模拟真实世界中开发者们那些千奇百怪、甚至变态级别的 Prompt。
AI 模型在发布前,必须经历极端环境的压力测试。
如果大张旗鼓地搞公测,一来容易暴露商业机密,被竞品盯上;二来开发者会带着「找茬」的心态去测试新模型,产生的数据存在偏差。
而这种「悄悄进村,打枪的不要」的灰度测试,能让 Anthropic 拿到最纯粹、最真实的盲测数据。
开发者在不知情的情况下,贡献了最真实的交互用例,而新模型也借此完成了最后一轮的「实战演习」。
然而,开发者并不傻子。当一个模型的智商突然从「优秀的本科生」跃升到了「顶尖的博士后」,那种手感上的差异无法掩盖。
比如,许多开发者都感觉到了新模型提升明显,在「鹈鹕骑自行车」的测试中,大大出彩。

现在,Opu生成鹈鹕骑自行车的SVG质量之高,堪比「一眼假」。

越来越多的开发者开始在论坛、Discord 群组里讨论近期模型的「间歇性神级表现」。
Leo最后也分享了用Opus制作的3D游戏。

如果这轮灰度测试真的是 Opus 5.2 的最后一次「野外拉练」,那么现在最值得关注的,已经不是它什么时候官宣,而是 Anthropic 到底把新一代 Opus 推到了什么高度。
毕竟,真正让开发者兴奋的,从来不是模型卡上的几个百分点,而是那种非常具体的「手感」 。
如果越来越多账号接下来持续命中 Opus-Next,那么Opus 5.2,可能真的已经站在门后了。
参考资料:
编辑:大卫