LLM 大爆发,一天之内推出三款前沿产品。竞争对消费者和企业来说都是好事。

模型刚发布,云栈社区 的小伙伴就迫不及待地开始了一手测试。
3D 场景
Grok 4.6 vs DeepSeek V4 Pro vs DeepSeek V4 Flash vs GPT-5.6 Sol
这一局其实差距很小。

Grok 4.6 和 DeepSeek V4 Pro 在原始质量上非常接近。如果把生成速度也考虑进去,我大概会选 Grok 4.6。不过和 Kimi K3、Opus 4.8、Qwen 3.8 Max 放在一起比,还是有不小差距。
来源: https://x.com/OmedVibeCodes/status/2087660331761811533
Flappy 游戏
通过 FlappyBench 测试了 DeepSeek V4 Pro 0813、Kimi K3 和 GLM 5.2。三个模型使用相同的提示词和 /design 命令。

评分从游戏玩法功能、UX/UI 和成本三个维度展开:
- DeepSeek V4 Pro 0813 → 8/10 · $0.0005
- Kimi K3 → 9.5/10 · $0.0740
- GLM 5.2 → 9/10 · $0.0480
DeepSeek 的价格只有 Kimi 的 1/148、GLM 的 1/96,却做到了它们 84% 的质量。用 $0.0005 就能生成一个可玩的单次游戏,这个价格确实离谱。Kimi K3 的输出质量最好,GLM 5.2 紧随其后。
来源: https://x.com/CommandCodeAI/status/2087631884406939727
飞机滑行动画
Grok 4.6 和 DeepSeek V4 Pro 刚刚发布,就有人拿来测了一段基础动画:让飞机在海面上滑行。测试只使用原始模型,没加任何辅助框架,结果与 DeepSeek V4 Flash 以及 Fable 放在一起对比。

输出结果:
- Grok 的飞机向后移动
- DeepSeek V4 Pro 在某一轮转向后移动,另一轮又向前
- DeepSeek V4 Flash 方向正确,不过有自己的风格
- Fable 依然是明显的胜者
Grok 生成的画面确实精美,但在现实物理规律方面还有困难。希望后续能继续改进。
来源: https://x.com/Terry_Djony/status/2087729113578758504
|