找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4269

积分

0

好友

557

主题
发表于 1 小时前 | 查看: 4| 回复: 0

如果你正在用 20 美元的 Codex Plus,这次先别急着掏 100 美元升级 Pro。
你账户里已经有的 GPT-5.6 Luna,刚刚降价 80%。把它的 Max 推理打开,再让 Sol 只负责那些必须动脑、必须拍板的部分,20 美元的使用体验,真的会往 100 美元那一档靠。

我不是说 Luna 突然把 Sol 干掉了。真这么用,十有八九要返工。我把官方价格、公开跑分和社区里的正反实测放到一起,最后只留下一个有点儿慢、但特别省钱的分法:

Sol 想清楚,Luna 干重活。

先把这事为什么省钱讲明白,后面我直接给你一段能复制的提示词。

Luna 便宜 80% 以后,Plus 最浪费的用法就是还让 Sol 包办一切

8 月 1 日,Codex 负责人 Tibo 做了一件很疯的事。他重置了 Codex 和 ChatGPT Work 的使用额度,还让大家周末去跑 10 万个 Luna 任务。

10 万个任务当然有点夸张。Tibo 真正想说的是,OpenAI 把 Luna 的 API 价格砍掉了 80%,在 Codex 订阅里跑 Luna,额度也能省下一大截。

这时候还让 Sol 从读资料、搜代码一路干到写测试,很多额度其实都花在了重复执行上。Sol 当然干得了,只是每一步都用它,太贵。

先去把 Luna 的 Max 打开。Codex 默认不会把所有推理强度都摆在模型选择器里,你要进入 设置 → 配置 → 模型功能,在 可用推理强度 里勾选 Max。想在模型选择器里看到 Ultra,再打开下面的 Ultra 开关。

打开以后也别见任务就上 Max。查一段代码、整理资料,用 High 或 X High 就够了。只有任务已经说清楚,又需要它长时间读文件、改代码、跑测试时,Max 才划算。

Dan McAteer 给了个更直观的实测结论:Luna Max 大约能到 Sol Medium 或 Opus 5 Medium 的水平,成本只有六分之一。

先别急着把这句话理解成 Luna 已经能替代所有贵模型。Artificial Analysis 的 Coding Agent Index 里,Luna Max 大约 75 分,确实已经贴近 Sol Medium。图里对比的 Claude 是 Opus 4.8 Medium,不是 Opus 5,注意别看错了。

社区实测也没有一边倒。Evan Reiser 跑了大约 10 个并行任务,Luna Max 成功率约 70%,成本低约 70%。Sol 完成同类任务更快,耗时和轮次大约少一半。

我反而觉得这组结果最有用。

Luna 不是拿来赌最难的那一题,它适合接住那些已经讲清楚、做错了也能靠测试发现的活。

老金现在只让 Sol 做判断,剩下的尽量交给 Luna

比如你让 Codex 给一个老项目加新功能。以前最省事的做法,是把整件事扔给 Sol,然后等它从头干到尾。确实稳,但额度也下得快。

我现在会先让 Sol 把项目读明白。它只需要告诉我:真正要改哪几块,哪些工作互不影响,最后跑什么测试才算完成。

路铺好以后,Luna 再进场。一个 Luna 去查相关代码和文档,一个 Luna 改边界清楚的文件,另一个 Luna 补测试。它们各做各的,不抢同一批文件。最后还是 Sol 回来读改动、跑测试、收口。

社区里也有人这样用。TheHBrand 把 Luna 放在编码、测试和小任务执行的位置,让 Sol 负责架构、规划和代码审查。Sol 发现问题,再把已经说清楚的修改丢回给 Luna。这套用法跟我现在的分工很接近。

这样分工,Luna 做错也不可怕。

测试没过,主任务能马上看到。连续两轮还修不好,就别再跟便宜模型死磕,直接把问题收回给 Sol。

哪些活可以先给 Luna?搜代码、读文档、整理资料、翻译、批量改格式、补测试、跑测试,这些边界清楚的活儿都合适。

那什么还得留给 Sol?需求本身没说清、要跨模块找根因、涉及架构取舍,或者前面已经失败过两轮,这些没想清楚、又不能随便试错的烂事儿。发布、付款、删除和生产环境操作也留在主任务,不要交给后台任务自己决定。

说到底,省钱不是每次都选最便宜的模型。省钱是别让最贵的模型一直做便宜的活。

复制这段提示词就能跑

先把主任务切到 Sol,再找一个边界清楚、最后能跑测试的小活,把真实任务填进下面这段提示词:

请按下面的模型分工完成任务:
[把你的真实任务写在这里]

当前主任务负责读取需求、拆分工作、划分文件所有权,并写清最后怎样验证。
把边界清楚、可以并行的执行工作创建为独立后台任务,优先指定 gpt-5.6-luna,推理强度默认使用 xhigh,确实需要长时间读文件、改代码和跑测试时再使用 max。
最多同时创建3个后台任务,每个任务负责不同的文件或主题,不要互相覆盖。
后台任务完成后,由主任务检查改动并运行测试。
如果Luna连续两次没解决同一个问题,把它收回给Sol处理。
发布、发送、付款、删除、账户和生产环境操作不要交给后台任务。
如果当前环境不能创建可指定模型与推理强度的后台任务,直接说明限制,不要假装已经创建。

提交以后,先看它有没有真的创建后台任务,每个任务负责什么、用了哪个模型。最后别只看它说完成了,要让主任务检查文件、跑测试。测试真的通过,这次分工才算省到了钱。

同类任务做多了,再把 Luna 固化成全局代理

这段提示词解决的是眼前这一次。要是你已经拿它跑过几个真实任务,发现每次都在做同类的拆分、验证和汇报,就别再把整段提示词复制来复制去了。真正值得保存的,是已经跑顺的工作边界。

Codex 现在支持把个人级自定义代理单独放在 ~/.codex/agents/ 里。文件名可以叫 luna-worker.toml,但真正的调用名以 name 字段为准。我的建议是,先把 Luna 定义成一个只接边界清楚任务的执行位,别把它写成什么都能干的万能 Agent:

name        = "luna_worker"
description = "Fast worker for clear, narrowly scoped, and repeatable tasks."
model       = "gpt-5.6-luna"
model_reasoning_effort = "xhigh"

developer_instructions = """
Work only within the assigned task scope.
Do not modify unrelated files or take external, destructive, financial, account, or production actions.
Work independently, verify the result when practical, and report changed files and verification.
If the task boundary or acceptance criteria are unclear, stop and report the missing information.
"""

写入之前,先读同名文件,别上来就覆盖。写入以后,新开或刷新一次 Codex 会话,再拿一个最小任务试跑。文件存在只是第一步,主任务真的能叫到它、它有没有按边界工作,才算配置完成。

调用时直接说:

请使用 luna_worker 子代理完成以下任务:[填写任务]。
等待它完成后,检查文件改动并运行对应测试,再汇总结果。

如果只是查代码、整理资料和补测试,没必要把所有任务都固定在 Max。只有长时间读文件、改代码和跑测试时,才把 model_reasoning_effort 改成 max。这样配,Luna 负责执行,Sol 负责判断,省下来的才是额度,而不是把便宜模型也用成贵模型。

等提示词和自定义代理都跑顺以后,再把它和实际踩过的坑交给我开源的 Meta Skill Creator,做成自己的可复用 Skill。

Meta Skill Creator 会先问清谁来用、最后交什么、怎样才算真的能用,再决定哪些内容放进 SKILL.md,哪些变成资料、脚本和测试。下次再遇到同类任务,直接调用 Skill 就行,不用重新复制一整段提示词。

这一步别搞反了。先用提示词跑通,再做 Skill。否则你只是把一段还没验证过的提示词永久保存了下来。

在 GitHub 搜索 KimYx0207/Kim_Service,进入仓库的 skills 目录,就能看到 meta-skill-creator

如果你是 Plus 用户,今晚就做两件事。去设置里把 Luna Max 打开,再把一个真实任务填进上面的提示词。

下一个复杂任务别一股脑全塞给 Sol。先让它把路想清楚,只放一个 Luna 出去。文件改对了,测试跑绿了,再开第二个。

写到这里,我又回头看了 Tibo 那句让大家去跑 10 万个 Luna 任务。

一开始我只觉得这很疯。后来才意识到,Tibo 其实是在提醒所有人:AI 开始变便宜了,我们用它的方式也得跟着变。多跑几个任务只是表面,真正的变化是普通人终于敢把工作铺开了。

以前一个想法冒出来,要先算时间、算人手、算额度。算到最后,很多想法根本走不到失败那一步。还没开始,人就先告诉自己算了。太贵、太慢,一个人做不完。

现在 Sol 可以把混乱理成一条路,Luna 沿着这条路去搜代码、改文件、跑测试。一个不够,就再开一个。方向仍然握在你手里,最后那一下判断也还是你的。但那些曾经会把一个人拖垮的重复劳动,终于能被交出去。

这才是 Luna 降价 80% 最让我兴奋的地方。

20 美元不会凭空变成 100 美元套餐。可一个只有 20 美元预算的人,第一次有机会像一支小团队那样工作。人还是那个人,手里却多了一支不会累的小队。他把有限的聪明留给判断,把大量的执行交出去。

再往后,人与人之间会在另一个地方拉开差距。

有人仍在追最贵的模型,等一个更聪明的答案。

有人已经开始安排一群不同价格的智能,把一个原本做不起的想法,慢慢做成真的。

Luna 价格降了 80%。
跟着降下来的,还有一个普通人把想法变成现实的门槛。




上一篇:Coldcard硬件钱包PRNG漏洞致7000万美元被盗,受影响版本与修复指南
下一篇:Stirling-PDF:8万 Star 的开源 PDF 工具箱,本地部署告别 Adobe
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-8-3 05:37 , Processed in 1.107814 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表