假期宅家,正好把手头的项目推进一下。最近用 Codex 的 GPT 6 Astra 画原理图,两个任务跑完,额度条就跟漏了气似的。换到 6.1 Sol 之后又跑了一下午,同样的活,同样的档位,钱包完全是两种感受。作为开发者社区的一员,这种模型选型的成本优化经验值得记录,今天简单聊聊。
01 额度不够用
前阵子来了一个项目。原理图我是真懒得从头画,直接丢给 Codex,模型选了 GPT 6 Astra,想看看效果。Max 没敢开,只开到 High,想着控制一下成本。
Codex 里的模型档位挺多:GPT-6.1 Sol(我今天才更新的)、GPT-6 Astra、GPT-6 Sol、GPT-6 Luna,具体如下图所示:

第一个任务跑完,原理图是真画完了,质量还是差点意思,还要改不少。就是额度掉得我心慌。好家伙,5 小时窗口的额度肉眼可见往下掉,周窗口也跟着掉。我一看这架势,用掉了 1 次重置机会,想着满血复活接着干。
第二个任务跑完,额度又差不多见底了。
额度是真不禁用 🕳
高档位做复杂活,一轮下来消耗是成倍的;重置机会看着有三张牌,真打起来两次就见底。
这里我得说句公道话:Astra 干活确实还行,但是原理图还是有点差距,目前没达到我的要求,可能没有开到 max 的缘故。据说用 KiCad 比较适配,我这边接的是 AD(Altium Designer)。其中一张原理图:


项目相对是比较简单的,不复杂,即便如此,这个消耗速度,说实话,有点用不起。重度开发使用就俩字:肉疼。
02 6.1 Sol 来了
正纠结呢,9 月 30 日 OpenAI 官方发了条推:
GPT-6.1 Sol: near-Astra intelligence for a fifth of the price.
翻译过来:接近 Astra 的智力,五分之一的价格,今天你能用上的性价比最高的模型。这其实是非常典型的通过大模型迭代优化来压低推理与使用成本的策略。

Agent Arena 的 Best Overall 榜:GPT-6.1 Sol 排第 5,胜率 11.23%;Astra 排第 4,12.27%,俩人就差 1 个百分点;实力相当?

排名是排名,再看看成本。这是 Agent Arena 的单任务成本表,红框是我框的,具体如下图所示。这数据体现的其实是在 AI Agent 执行真实任务时对工具链调度与 token 消耗的综合成本对比。

单任务成本按 P50 算,两项摆一起看更直观:
| 单任务成本 |
GPT 6.1 Sol |
GPT 6 Astra |
| P25 |
$0.16 |
$0.69 |
| P50 |
$0.57 |
$3.04 |
| P95 |
$5.64 |
$36.07 |
| 官方定价 |
$2 /$10 |
$10 /$50 |
5.3 倍的差距。还有一个细节,我觉得比价格本身有意思:单任务输出 token,Sol 是 27.2K,Astra 是 26.9K,基本持平。合着它不是靠少干活省钱,是单价真的低。如果你不依赖 Codex 集成环境,而是自己去对接 模型 API 或者中转站,这种基础单价上的差距会被进一步放大。
03 实测一下
光看数据不过瘾,下午正好来了个活,直接上手试(当然测试可能不太严格,6.1 没测画原理图了,仅代表我个人主观感受)。
那块开发板刚拿到手,环境也得自己搭。我干脆把 Codex 当外包用,模型切到 GPT-6.1 Sol,档位 High,一下午连着派了三个任务。
TASK 01 下载官方资料
用时 1 小时 17 分 42 秒。

TASK 02 搭建开发环境
用时 2 小时 28 分 40 秒。派活的原话就仨字:「搭建开发环境」。任务完成后,关键我没让你编译,你居然也帮我编译好了,不得不说,还是方便。

TASK 03 配置烧录工具
用时 17 分 22 秒。原话「如何烧录固件,帮我配置好烧录的工具」。最后它交了句实话:目前没有检测到 COM 口,尚未烧录。

三个任务连起来,从派第一句话到工具配好,中间隔了五个多小时。
它卡住的这个地方「没有检测到 COM 口」,我一看设备管理器就明白了:USB 转串口用的 CP2102 模块,插上电脑后躺在「其他设备」下面挂着黄色感叹号,COM 口没有,烧录工具压根认不到板子。这属于很典型的硬件底层驱动兼容性问题,排查起来其实不难,难的是顺着现象一步步定位到设备管理器:

三个任务加一个驱动,一下午就这么过去了。收工前我又点开额度面板看了一眼——还是开头那张,说实话有点意外。5 小时窗口还剩 71%,1 周窗口还剩 95%,3 次重置机会一次没动。

样本就这一天,干的活也说不上是极限压力测试,参考意义确实有限。但主观感受挺直接:同样开 High,Sol 的额度掉速比 Astra 慢得多,一下午下来我一次都没起过「额度要没了」的念头。
04 主观体验
先说清楚:没做严格测试,没有做横向的对比,纯主观感受。
- Token 掉速:同样开 High,Sol 明显比 Astra 经用,一下午没触发我对额度的焦虑。
- 响应质量:修驱动、配环境这种活,没感觉出和 Astra 的差距。
05 写在最后
这么一整,反正环境顺利搭建好了,没出啥问题,固件烧录之后,也把板子成功运行起来了。效率提升不少。这篇是我纯主观的使用记录,如果你也在用 GPT-6.1 Sol,欢迎来评论区聊聊,给大家一个参考。