华木建材有限公司

全网骂Claude变笨,Anthropic下场揭秘:坑你的不是模子

发布日期:2026-08-16 11:11    点击次数:130

全网骂Claude变笨,Anthropic下场揭秘:坑你的不是模子

换更大的模子就等于更智谋?

【导读】换更大的模子就等于更智谋?这可能是Claude Code用户最深的诬陷。好多东谈主为此沿途换到最贵的Fable,近日,Anthropic,亲手暴露了这个误区。

你有莫得过这种时刻:Claude Code写代码写砸了,第一反映,即是飞速换个更强的模子。

但这一招,好多时候并岂论用,以至是在白用钱。

近日,Anthropic官方发了一篇长文特意来讲这件事。

Anthropic官方长文

启事是太多东谈主把Claude Code里的两个选项搞混了:

一个是模子采取(Model),一个是努力度(Effort)。

Anthropic官方长文

当年,大众对这两个选项的统一王人很浅薄:换更大的模子,AI就更智谋;把Effort调高,无非是让AI多想一会儿。

而就在本年3月,这个诬陷还惹出了一场不小的广泛。

其时,不少开导者发现,手里的Claude Code一会儿「变笨」了。该读的文献不读,该跑的测试不跑,任务干到一半就撂挑子,反过来问你要更多信息。

于是,GitHub上骂声一派。

最狠的一刀来自AMD的AI表示东谈主Stella Laurenzo。

她在GitHub上翻出6852个会话的日记,实测Claude的想考量比2月之前掉了67%,撂下一句:

Claude如故没法被信任,去干复杂的工程活了。

Claude如故没法被信任

早先,大众还认为是我方的辅导词没写好,或者那里建设错了。折腾半天才翻然醒悟:问题根本不在我方身上,是Anthropic暗暗改了一个建造。

3月4日,为了压低延伸,他们把Claude Code里的Effort选项,默许档位从high降到了medium。

官方更新日记里也写了,可大无数东谈主并没端庄到,他们仅仅嗅觉到,手里的模子无风不起浪能够变蠢了。

扛了一个月,Anthropic才在4月7日把默许档位召且归,还给系数订阅用户重置了一次用量额度。

而无数东谈主这时才知谈,这个开关一直就在我方手边,它在灰暗决定着:AI到底肯不愿为你满血干活。

Model换的是脑子,Effort换的是作风

Anthropic官方的拆解,不错浅薄总结为这么一句话:

Model换的是脑子,Effort换的是作风。

先说Model,它换的是脑子。

每个模子背后是一套「冻结的权重」,它的材干和知识,在磨砺限度那一刻就被焊死了:只读、不可改。

这意味着,你推理时喂进去的辅导词、CLAUDE.md、贴进高下文的代码,完全改变不了它的这套权重:你不错辅导它,却没法「磨砺」它。

换模子,本体即是换一整套权重来接你的活,是以它料理的是「会不会」的问题。

一个在模子磨砺时还不存在的库,你把文档整篇喂给它,它能现学现用,可那只对这一次肯求管用,模子本人一个字王人没记着,转头就忘。

它偶尔会一册正经地调用一个根本不存在的API,亦然消亡个兴味兴味。那并非查漏了,是权重照着磨砺里的眷恋路,硬拼出一串东西。

再往底层看一眼,就更明晰了。你写的const x = await fetch,在模子眼里先被切成一个个token,每个换成词内外的一个数字。

图源:Anthropic官方博文

你写的一瞥代码,被切成token后各自对应词内外的一个整数:const是1078,await是2597,词表约10万个。模子拿到的从来不是翰墨,是这串数字。

模子不是衔接吐出整段谜底的。它一次只谋齐系数token,接上去,再把整串再行算一遍,谋划下一个。一段两百个token的恢复,即是两百次好意思满的运算。

你等的时候、你烧的钱,大头全在这个轮回里。

再说Effort,更换的是「作风」。

好多东谈主认为高Effort即是「多想几秒」,错了。

它管的是Claude在此次任务上到底进入几许使命量:读几个文献、跑不跑测试、要不要零散考据、要不要把一个多重要任务沿途推到底再总结找你。

说白了:低Effort的Claude,倾向于快速恢复,然后反过来问你要更多高下文,能不伊始就不伊始;高Effort的Claude,倾向于我方去翻信息、多调几次器具、衔接把长任务链跑完。

Effort在Claude Code里分红好几档,日韩簧片别把它当成一条拘泥的token预算线。

它是个行径信号,告诉Claude这活得干到多透彻、多有主办才算完,文本恢复、器具调用、膨胀想考,全在它的统治鸿沟里。

官方还放了一张默示图:消亡条prompt,高Effort能比低Effort多吐约莫7倍的token。多出来的那些,全花在读文献、跑考据、反复阐发上了。

图源:Anthropic官方博文

消亡条prompt,高Effort旅途生成的token约为低Effort的7倍,多出的全花在读文献、跑考据、反复阐发上。

这里藏着一个反直观的论断:小模子开高Effort,完全可颖慧翻大模子开低Effort。

不会,如故不够努力

知谈了单干,确实灵验的,是官方给的那套判断框架。

图源:Anthropic官方博文

官方判断框架:Claude作念错了,先问它是不够智谋如故不够努力,再决定换模子如故加Effort。

Claude干砸了,先别急着动模子选项。

第一步恒久是回头查高下文:prompt诠释晰了吗?该给的器具给了吗?CLAUDE.md配对了吗?大无数所谓「AI变笨」,根子王人在这儿,不在模子选项上。

高下文照实没问题、它如故错,就问我方一句:它是不会,如故不够努力?

「不够努力」,很好判断:该读的文献跳过了、测试没跑、重构干到一半跑总结问你:它缺的不是脑子,是进入。

这是Effort的事,不错往上调一档。

如若「不会」,则是另一种情形:你高下文给足了,它也显着悉力了,可如故错,换个说法再试一遍如故错。

这时候任你若何加Effort王人骤然,这是模子的事:就要换更强的。

官方还打了个特地好懂的比喻。

Sonnet,是个有一系数这个词下昼的万能选手。

它会把你的代码从新读到尾,跑一遍、再验一遍,临了是真把你这摊活儿吃透了。

Opus,是只给你五分钟的大家。它带来的是你代码库里根底莫得的教化,见过的坑、该绕的雷,全是解过一堆同类问题攒下的直观。可五分钟就那么点时候,只够它扫一眼,不成扫遍系数文献。

Fable,是系数东谈主王人卡住了才请得动的专业。哪怕只给五分钟,它也能一眼揪出别东谈主谁王人没看出的那处纰缪。

诚然,这位大家每个token也最贵,得留给确实没东谈主能接的硬骨头。

是以才有阿谁反学问的论断:

一个Sonnet开高Effort,在不少活儿上真颖慧过Opus开低Effort。小模子配上实足高下文和高进入,能扛下的事比你联想的要多得多。

图源:Anthropic官方博文

长任务、多重要活上,Fable拉开最大差距,官方测试里有些任务Opus和Sonnet开到任何Effort王人够不着。

卷完模子名次榜,给AI派活成了硬时刻

这篇官方解读,名义上是教你调参,背后是一个遑急的转向:

AI编程的竞争,正在从「谁的模子更强」,转向「谁更会调遣智能体」。

当年很浅薄,东谈主挑一个最强的模子,剩下的全交给它。

现时不相同了。你得像个口头司理那样,给不同的模子派不同的脚色、定不同的进入档位:

浅薄的改换交给Sonnet挂低档,秒回还省钱;大型重构上强模子加高等;要万古候我方跑的智能体任务,强模子配足Effort。

这些操作,不仅能把活干得更好,省下来的,王人是真金白银的token账单。

Claude Code的Effort菜单里多出的那档ultracode,即是把这套「调遣」作念进了居品。

选中它,Claude拿到的是xhigh的火力,外加一项授权:遭逢实质性的活儿,我方权衡要不要拉起一支智能体军队,把任务拆下去并行干。

回头看3月那场「变笨」风云。

它能惊动系数这个词社区,偶然因为大无数东谈主还停在「换模子」的老想路里,敌手边这个更要命的Effort选项浑然不觉。

只看模子名次的期间正在当年,调遣模子,正在成为中枢时刻。

谁先学会给AI派活,谁就能抢先一步,用上阿谁确实肯为你卖力的Claude。不然,你手里再贵的模子,也仅仅一个更贵的搜索框。

这么,你烧的每一分token,才算真花在了刀刃上。

参考贵府:

https://claude.com/blog/claude-model-and-effort-level-in-claude-code

https://x.com/ClaudeDevs/status/2074900291062034618?s=20

https://platform.claude.com/docs/en/managed-agents/multi-agent

裁剪:元宇

本文来自微信公众号“新智元”,作家:ASI启示录,36氪经授权发布。





Powered by 华木建材有限公司 @2013-2022 RSS地图 HTML地图