找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

5178

积分

0

好友

731

主题
发表于 4 小时前 | 查看: 4| 回复: 0

AI推理努力控制旋钮与成本/准确率关系示意图

现在有些 AI 回答前会先「想一会儿」,屏幕上转一圈「思考中」,然后才把答案给你。

这一段「想」不是装样子。模型在正式作答前,会先生成一大串推理文字,把问题嚼一遍,再动笔写给你看的答案。

新一代模型还把这件事做成了一个旋钮:不久前发布的 GPT-5.6,在 OpenAI 的编程工具 Codex 界面里给了六档「思考努力」,从 Light 到 Ultra,你能直接调它想多久。

那这个旋钮到底该往哪拧?想得越久,是不是就越聪明?把它拉到最高,值不值?

这篇就想把三件事讲清楚:AI 的这个「想」到底是什么、能调到哪、又该调多少。结论先放这儿:想得越久通常越准,但这是一条很快就拐弯的曲线——拧到最高,往往是在为无用功付钱。

材料来自 Sebastian Raschka 上周的综述《Controlling Reasoning Effort in LLMs》。Raschka 是机器学习教育圈的一线作者,写过畅销书《Build a Large Language Model (From Scratch)》。他这篇把六家主流模型的做法摊开对比了一遍,下面的数字都据这篇综述转引各家官方报告,不是我们自己实测。

那一段「想」,其实是它写给自己看的草稿

业内管这段「想」叫 reasoning tokens,直译是「推理 token」。说人话:它就是模型在正式回答你之前,先写给自己看的一长串思考过程。

它会把问题拆开,一步步往下推,写到哪儿觉得错了还会退回来改,改完接着往下。这段草稿写完,它才从里面提炼出给你的最终答案。后面老提到的 token,你可以粗略理解成模型眼里的字词单位——草稿写得越长,用掉的 token 就越多。

为什么先写这么一段草稿,答案通常会更准?道理和人做题差不多:心算容易翻车,在草稿纸上一步步列出来就不容易出错。模型多写这一段,等于逼自己把推理链条走完整,而不是凭第一反应直接甩结论。

你在 ChatGPT 或者 Codex 里看到的「思考中」,界面通常会把这段草稿折叠起来,只把最终答案端给你。

这里 Raschka 还澄清了一个常被误会的点:模型输出里那对 \u003cthink\u003e 标签,本身并不会让它更会想。它只是个书签,标出草稿从哪开始、到哪结束,方便界面折叠隐藏。真正让答案变好的,是草稿的内容,不是这个标签。

从「要么想要么不想」,到能拧的六档旋钮

早一代的推理模型很轴。像 DeepSeek-R1,不管你问的是难题还是「今天几号」,它都要啰啰嗦嗦想一大通,还没法关掉。

后来的模型学乖了,把「想不想、想多久」做成了一个可调的档位。

GPT-5.6在Codex界面中的推理努力档位设置及成本曲线对比

上图右边就是 GPT-5.6 在 Codex 里的真实界面:一个 Effort(努力)下拉菜单,六个档从 Light、Medium、High,一路到 Extra High、Max、Ultra。最高那档下面还写着一句「Consumes usage limits faster」,翻译过来就是「更费额度」。你把档位往上调,就是让它答题前想得更久、写更长的草稿。

它是怎么做到「同一个模型,想多想少随你调」的?OpenAI 没公开 GPT-5.6 的实现,但它去年开源的 gpt-oss 露了底。

推理模型将推理努力等级注入系统提示词的流程示意

秘密朴素得有点意外:调档位,其实就是在你的问题前面偷偷加一句话。

你选了 High,系统就在发给模型的那段隐藏指令——业内叫 system prompt,也就是每次对话前塞给模型、你看不见的一段设定——里,写上一行 Reasoning: high。模型看到这行字,就知道这次要多想想。权重还是同一套,变的只是开头那句话。

越想越准,可拐点来得比你以为的早

那把旋钮往上拧,会发生什么?三件事同时发生:思考的草稿变长、花的钱和时间变多、答对的概率也往上走。 前两件是代价,第三件是收益。麻烦在于,收益涨着涨着就涨不动了。

gpt-oss不同推理努力档位下的草稿长度与准确率关系折线图

这是 gpt-oss 在两个测试集上的真实曲线,据它发布时附带的官方模型卡。横轴是草稿长度,纵轴是准确率,三个点分别是 low、medium、high 三档。你能清楚看到:从 low 到 medium,准确率蹿得很猛;可从 medium 到 high,草稿差不多翻了倍,准确率只往上挪了一点点。

前半段,每多想一分都很划算;后半段,每多想一分都在打水漂。

这个「涨到某处就压平」的拐点,在更强的模型上更明显。文章开头 GPT-5.6 那张图,画的就是它最大的模型 Sol:据第三方测评站 Artificial Analysis 的编程测试,档位一路往上,调用模型花的钱在猛涨,分数却越涨越慢,到最高那几档基本是花冤枉钱。

刚开源不久的 Inkling 给了另一组更细的数据。它出自 Thinking Machines Lab,没用「低中高」这种档,而是给了一个 0 到 1 的连续刻度。

多个推理模型在不同基准测试中的推理努力与性能/成本对比散点图

据这份报告,他们把努力值从 0.2 一路扫到 0.99:总体上是越使劲、草稿越长、分数越高,但涨得并不均匀。 上图那条蓝色曲线在前段陡峭,到后段就开始摇摆压平。其中一项测试(图上标着 IFBench)里,努力拧到高档,分数不升反降,从峰值还掉了一点。这也是为什么不能闭眼往死里拧。

拧满往往是在为无用功付钱

既然后半段这么不划算,那反过来想:能不能让模型少想一点,还不掉分?能,Kimi K2.5 就专门做了这件事。

Kimi K2.5通过Toggle方法在保持性能的同时大幅降低Token消耗的雷达图对比

上图是 Kimi 团队自己的对比,据 Kimi K2.5 技术报告。左边是各项测试的成绩,右边是花掉的思考 token。他们用一种叫 Toggle 的训练方法,把模型思考用掉的 token 砍掉了大约 25% 到 30%,成绩几乎没动。 右图七项测试的 token 用量全线下降(图上标着「Reduced: 7 / Increased: 0」),左图的总成绩基本原地不动。

这组数据说的其实是同一件事:很多时候模型那段草稿是注了水的,砍掉这部分水,答案照样对。 换句话说,日常大量场景里把旋钮拧到最高,多花的那部分钱,买的是一堆对结果没帮助的废话。

这个旋钮是怎么造出来的

模型天生并不会「看指令决定想多久」。这个本事是训练时特意教的。Raschka 拆了六家的做法,挑最好懂的三种说。

三种主流推理努力控制训练方法对比示意图:话唠罚款、随机掐断与无级变速

第一种,训练时给「想太长」记过。 模型每写长一分,就按长度扣一点分,逼它学会用尽量短的草稿把题做对。想让某档少想点,就在那档把「写长扣分」调狠一点。这招业内叫 length-penalized RL,说白了就是「话唠罚款」。

第二种,训练时故意把草稿掐断在各种长度。 英伟达的 Nemotron 会拿正常的思考草稿,随机在不同位置一刀切掉,再让模型学着从半截草稿直接跳到答案。这样练出来的模型,哪怕思考被中途叫停,也能稳稳收尾给结论,而不是卡在半路。你给它设一个「最多想这么多」的预算,它就守得住。

第三种,直接给一根 0 到 1 的连续刻度。 前面的 Inkling 就是这么干的:它没用「低中高」的档,给的是一根像无级变速那样的旋钮,你写 0.8 它就使八成力。训练时把要的努力值告诉它,同时按这个值调整「写长扣多少分」,它就学会了对着刻度收放。

三种做法路子不同,共同点是:「想多久」这件事,是在训练台上一点点喂出来的,不是模型自带的开关。

它正在变成新模型的标配

把这几家摊开看,一个共同的走向很清楚:「让用户自己调 AI 想多久」这个旋钮,正在从少数旗舰的花活,变成新模型的标准配置。 GPT-5.6、gpt-oss、DeepSeek、Nemotron、Kimi、Inkling,路数各异,做的却是同一个旋钮。

对每天在用 AI 的人来说,这个旋钮意味着「想多久」的选择权,第一次真正交到了用的人手上。简单的活儿——比如改个错别字、归个类——其实用不着让它拧到 Ultra 深想一遍;真正的硬骨头——比如一段绕人的代码、一道多步推理题——才值得把档位往上抬。

Raschka 在结尾还留了个更远的悬念:最理想的状态,是模型自己看一眼任务就知道该想多久,不用你手动选。OpenAI 早先的 GPT-5 Auto 模式试过这个方向,效果不太行,后来悄悄从界面里撤了。

这根旋钮眼下还得靠人手动拧。而拧到哪一档最划算,暂时还没有哪个模型能替你算准。这恐怕也是当下 AI 推理模型 留给使用者的一道附加题:你不仅要知道它能怎么想,还得学会替它决定该想多少。




上一篇:知识图谱表示与本体构建:从三元组到超图的4种扩展与6个关键方法
下一篇:Claude Opus 5 生成 FPS 游戏:单 HTML 文件,4武器10 AI,3分钟突袭
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-7-28 05:46 , Processed in 0.886002 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表