全网骂Claude变笨,Anthropic下场揭秘:坑你的不是模子


换更大的模子就等于更智谋?
【导读】换更大的模子就等于更智谋?这可能是Claude Code用户最深的诬陷。好多东谈主为此沿途换到最贵的Fable,近日,Anthropic,亲手暴露了这个误区。
你有莫得过这种时刻:Claude Code写代码写砸了,第一反映,即是飞速换个更强的模子。
但这一招,好多时候并岂论用,以至是在白用钱。
近日,Anthropic官方发了一篇长文特意来讲这件事。

Anthropic官方长文
启事是太多东谈主把Claude Code里的两个选项搞混了:
一个是模子采取(Model),一个是努力度(Effort)。

Anthropic官方长文
当年,大众对这两个选项的统一王人很浅薄:换更大的模子,AI就更智谋;把Effort调高,无非是让AI多想一会儿。
而就在本年3月,这个诬陷还惹出了一场不小的广泛。
其时,不少开导者发现,手里的Claude Code一会儿「变笨」了。该读的文献不读,该跑的测试不跑,任务干到一半就撂挑子,反过来问你要更多信息。
于是,GitHub上骂声一派。
最狠的一刀来自AMD的AI表示东谈主Stella Laurenzo。
她在GitHub上翻出6852个会话的日记,实测Claude的想考量比2月之前掉了67%,撂下一句:
Claude如故没法被信任,去干复杂的工程活了。

Claude如故没法被信任
早先,大众还认为是我方的辅导词没写好,或者那里建设错了。折腾半天才翻然醒悟:问题根本不在我方身上,是Anthropic暗暗改了一个建造。
3月4日,为了压低延伸,他们把Claude Code里的Effort选项,默许档位从high降到了medium。
官方更新日记里也写了,可大无数东谈主并没端庄到,他们仅仅嗅觉到,手里的模子无风不起浪能够变蠢了。
扛了一个月,Anthropic才在4月7日把默许档位召且归,还给系数订阅用户重置了一次用量额度。
而无数东谈主这时才知谈,这个开关一直就在我方手边,它在灰暗决定着:AI到底肯不愿为你满血干活。
Model换的是脑子,Effort换的是作风
Anthropic官方的拆解,不错浅薄总结为这么一句话:
Model换的是脑子,Effort换的是作风。
先说Model,它换的是脑子。
每个模子背后是一套「冻结的权重」,它的材干和知识,在磨砺限度那一刻就被焊死了:只读、不可改。
这意味着,你推理时喂进去的辅导词、CLAUDE.md、贴进高下文的代码,完全改变不了它的这套权重:你不错辅导它,却没法「磨砺」它。
换模子,本体即是换一整套权重来接你的活,是以它料理的是「会不会」的问题。
一个在模子磨砺时还不存在的库,你把文档整篇喂给它,它能现学现用,可那只对这一次肯求管用,模子本人一个字王人没记着,转头就忘。
它偶尔会一册正经地调用一个根本不存在的API,亦然消亡个兴味兴味。那并非查漏了,是权重照着磨砺里的眷恋路,硬拼出一串东西。
再往底层看一眼,就更明晰了。你写的const x = await fetch,在模子眼里先被切成一个个token,每个换成词内外的一个数字。

图源:Anthropic官方博文
你写的一瞥代码,被切成token后各自对应词内外的一个整数:const是1078,await是2597,词表约10万个。模子拿到的从来不是翰墨,是这串数字。
模子不是衔接吐出整段谜底的。它一次只谋齐系数token,接上去,再把整串再行算一遍,谋划下一个。一段两百个token的恢复,即是两百次好意思满的运算。
你等的时候、你烧的钱,大头全在这个轮回里。
再说Effort,更换的是「作风」。
好多东谈主认为高Effort即是「多想几秒」,错了。
它管的是Claude在此次任务上到底进入几许使命量:读几个文献、跑不跑测试、要不要零散考据、要不要把一个多重要任务沿途推到底再总结找你。
说白了:低Effort的Claude,倾向于快速恢复,然后反过来问你要更多高下文,能不伊始就不伊始;高Effort的Claude,倾向于我方去翻信息、多调几次器具、衔接把长任务链跑完。
Effort在Claude Code里分红好几档,日韩簧片别把它当成一条拘泥的token预算线。
它是个行径信号,告诉Claude这活得干到多透彻、多有主办才算完,文本恢复、器具调用、膨胀想考,全在它的统治鸿沟里。
官方还放了一张默示图:消亡条prompt,高Effort能比低Effort多吐约莫7倍的token。多出来的那些,全花在读文献、跑考据、反复阐发上了。

图源:Anthropic官方博文
消亡条prompt,高Effort旅途生成的token约为低Effort的7倍,多出的全花在读文献、跑考据、反复阐发上。
这里藏着一个反直观的论断:小模子开高Effort,完全可颖慧翻大模子开低Effort。
不会,如故不够努力
知谈了单干,确实灵验的,是官方给的那套判断框架。

图源:Anthropic官方博文
官方判断框架:Claude作念错了,先问它是不够智谋如故不够努力,再决定换模子如故加Effort。
Claude干砸了,先别急着动模子选项。
第一步恒久是回头查高下文:prompt诠释晰了吗?该给的器具给了吗?CLAUDE.md配对了吗?大无数所谓「AI变笨」,根子王人在这儿,不在模子选项上。
高下文照实没问题、它如故错,就问我方一句:它是不会,如故不够努力?
「不够努力」,很好判断:该读的文献跳过了、测试没跑、重构干到一半跑总结问你:它缺的不是脑子,是进入。
这是Effort的事,不错往上调一档。
如若「不会」,则是另一种情形:你高下文给足了,它也显着悉力了,可如故错,换个说法再试一遍如故错。
这时候任你若何加Effort王人骤然,这是模子的事:就要换更强的。
官方还打了个特地好懂的比喻。
Sonnet,是个有一系数这个词下昼的万能选手。
它会把你的代码从新读到尾,跑一遍、再验一遍,临了是真把你这摊活儿吃透了。
Opus,是只给你五分钟的大家。它带来的是你代码库里根底莫得的教化,见过的坑、该绕的雷,全是解过一堆同类问题攒下的直观。可五分钟就那么点时候,只够它扫一眼,不成扫遍系数文献。
Fable,是系数东谈主王人卡住了才请得动的专业。哪怕只给五分钟,它也能一眼揪出别东谈主谁王人没看出的那处纰缪。
诚然,这位大家每个token也最贵,得留给确实没东谈主能接的硬骨头。
是以才有阿谁反学问的论断:
一个Sonnet开高Effort,在不少活儿上真颖慧过Opus开低Effort。小模子配上实足高下文和高进入,能扛下的事比你联想的要多得多。

图源:Anthropic官方博文
长任务、多重要活上,Fable拉开最大差距,官方测试里有些任务Opus和Sonnet开到任何Effort王人够不着。
卷完模子名次榜,给AI派活成了硬时刻
这篇官方解读,名义上是教你调参,背后是一个遑急的转向:
AI编程的竞争,正在从「谁的模子更强」,转向「谁更会调遣智能体」。
当年很浅薄,东谈主挑一个最强的模子,剩下的全交给它。
现时不相同了。你得像个口头司理那样,给不同的模子派不同的脚色、定不同的进入档位:
浅薄的改换交给Sonnet挂低档,秒回还省钱;大型重构上强模子加高等;要万古候我方跑的智能体任务,强模子配足Effort。
这些操作,不仅能把活干得更好,省下来的,王人是真金白银的token账单。
Claude Code的Effort菜单里多出的那档ultracode,即是把这套「调遣」作念进了居品。
选中它,Claude拿到的是xhigh的火力,外加一项授权:遭逢实质性的活儿,我方权衡要不要拉起一支智能体军队,把任务拆下去并行干。
回头看3月那场「变笨」风云。
它能惊动系数这个词社区,偶然因为大无数东谈主还停在「换模子」的老想路里,敌手边这个更要命的Effort选项浑然不觉。
只看模子名次的期间正在当年,调遣模子,正在成为中枢时刻。
谁先学会给AI派活,谁就能抢先一步,用上阿谁确实肯为你卖力的Claude。不然,你手里再贵的模子,也仅仅一个更贵的搜索框。
这么,你烧的每一分token,才算真花在了刀刃上。
参考贵府:
https://claude.com/blog/claude-model-and-effort-level-in-claude-code
https://x.com/ClaudeDevs/status/2074900291062034618?s=20
https://platform.claude.com/docs/en/managed-agents/multi-agent
裁剪:元宇
本文来自微信公众号“新智元”,作家:ASI启示录,36氪经授权发布。

