老金今天做了一个实测:让 DeepSeekV4-Flash 在 Claude Code 里搭建飞书工作台。它通过 Lark CLI 读取任务,根据生成的规则筛选优先级、风险项和后续任务,最终输出每天的播报卡片 JSON。整个过程发起了 215 次响应,花费约 1.5 元。
一句需求时推理有点小瑕疵,定时任务第一次运行就报错了,工作流甚至还猜错过原因。所以网上说 V4-Flash 是闭源模型的平替,老金并不认同——它会判断失误,也不该在缺少检查的情况下独自做决定。
不过,有了工具、日志、状态记录和可复跑的 harness 兜底,它已经能稳稳接住一条真实的中长流程。
我没用过 OpenCode,但这两天看到它的 Go 套餐消息,特意去核实了官方说明:首月 5 美元,之后 10 美元。并非无限量,有 5 小时、每周和每月额度。然而 DeepSeekV4-Flash 实在太便宜,官方按典型使用模式估算,5 小时能跑约 31650 次请求,差不多等于无限量随便用。
harness 开始比模型本身更重要的趋势越来越明显。当模型足够便宜又足够能干的时候,真正稀缺的就不再是一次回答,而是把工作拆成一连串能试错、能读回、能收住的流程。
|