我们的邮箱地址:

carnal@gmail.com

致电我们:

13594780345

热点资讯

  • Home
  • Claude智能下降引发全网热议,Anthropic无意间承认错误

Claude智能下降引发全网热议,Anthropic无意间承认错误

2026-08-24 7057

开发者argofowl在前日进行了长达一下午的深入排查工作,他为发现Claude智能的下降而感到困惑。起初,他怀疑是t3代码出现了故障,后来又认为可能是自己的代码有问题,甚至怀疑自己的Mac是否出了什么状况。然而,当他最后查看API的真实请求日志时,意外发现里面有个数字“10”,这让他大吃一惊,因为在Claude的后台,他明明选择的是“high”推理设置。令人遗憾的是,Claude的更新日志对此没有任何说明。

进一步分析后,argofowl发现自Claude Code版本2.1.237起,“high”推理等级被重新解释为“10 out of 100”,而这个数值其实是以前“low”级别模型所对应的值。深挖下去,发现Anthropic对Claude Code 2.1.236及以上版本进行了一个“压缩effort数值刻度”的实验,而旧版本和Opus 5则并未受到影响。显然这是一项A/B测试,并非所有用户都能遇到这种情况。对开发者来说,问题在于,虽然模型的表现会有波动,但把他们拉入实验而不提前通知,确实让他们摸不着头脑,明明是在调试自己的代码,却无意中调试了厂商的测试。

事情一经Tech博主Chubby的转发,引发了广泛的讨论,AI行业的关注迅速涌入,其中“Claude真的变笨了吗”的话题充斥着社交平台。许多人纷纷进行同样的输入测试,并对比不同版本的输出结果,甚至有人翻出两周前的对话记录进行细致分析。

面对这一波风潮,Claude Code的工程师Thariq Shihipar迅速做出了回应。他表示,当前进行的实验只是在改变effort的数值映射,因此有些用户可能看到Claude报告为“10”。他强调,虽然这个刻度不是从0到100,但用户所选的effort就是他们获得的效果。他们的团队进行了仔细评估,确保这一改变不会对此模型的表现产生影响。

然而,Chubby又指出,Opus 5的表现仿佛经历了一次明显的下降,常常只能粗略应对且频繁犯错,尤其是当其未按指令执行时只会反复机械地道歉。令人惊讶的是,几天前就有开发者注意到Opus 5存在显著的“智力下降”问题,除了前述问题,它还会不断出现bug并自我纠正,浪费大量时间。由于网友的频繁追问,Thariq再次公开承认,Opus 5的表现十分不稳定,团队优先事项是解决这个问题。

在这场风波中,涉及到的其实是整个AI行业的一个尴尬现状:跑分和用户体验之间的巨大差异。一方面,Opus 5的综合得分几乎没有问题,平均评分为82.72、SWE-bench Pro 79.2%、Terminal-Bench 86.7%;另一方面,用户的感受则截然相反,很多人评价其“啰嗦”“偷懒”“爱抬杠”。更为荒唐的是,两种截然不同的评价竟被同时归于同一个模型。

事实上,模型变笨并非Anthropic独有的困扰。目前,许多大模型在更新时变得越来越不透明,传统软件提供的详尽版本号、更新日志和回滚机制在这方面都不复存在。大模型服务以下的变更可能随时进行,有时还会进行A/B测试,调整量化方案或模型配置,唯一可用的依据便剩下用户的主观体验。可偏偏,用户的直觉往往是最容易被质疑和否定的部分。

这场风波揭示了行业长期存在的隐患:当模型成为基础设施时,它的稳定性便成了一种信任的契约。虽然高分可以用作营销,但稳定性却必须通过实际体验来不断证明。

发表评论