
9月25日,美团 LongCat 团队正式上线新一代预览版模型 LongCat-2.5-Preview,并在 OpenCode 平台开放为期两周的限时免费体验。

该模型总参数达到 1.6 万亿,每次推理激活约 480 亿参数,支持 100 万 Token 上下文窗口和原生多模态能力,主要面向长周期任务,可操作终端、浏览器、GUI、电子表格和设计工具等。值得一提的是,上一代 LongCat-2.0 是在国产算力集群上完成大规模训练的,并实现了万亿参数 MoE 模型的稳定训练与推理。

回到模型价格,LongCat API 开放平台新用户完成实名认证后,可免费领取 1000 万 Token。目前 LongCat 平台还提供 5000 万 Token 新手资源包,售价 9.9 元,均可用于 LongCat-2.0 和 LongCat-2.5-Preview。
LongCat-2.5-Preview 的 API 也在进行限时折扣:缓存未命中的输入价格由 5 元/百万 Token 降至 2 元,缓存命中输入由 0.1 元降至 0.04 元,输出由 20 元降至 8 元。
我们最初在 OpenCode 体验时,由于用户较多,模型一度无法及时响应。OpenCode 评论区中已经出现首批开发者的「省流」测试案例,比如让模型制作「鹈鹕骑自行车」的动画,成品存在一些动作与姿势的细节问题。

因此,我们随后改用 API,将 LongCat-2.5-Preview 接入 Claude Code 继续测试。面对连续、多步骤的 Coding 任务,它的实际表现究竟如何?下面直接看实测。
复刻现象级App Muse,核心交互基本跑通
首先,我们复刻了一款近期走红的 App——Meta Muse。Muse 上线后仅 10 天便登顶美国 App Store 免费应用总榜,一度超过 ChatGPT。

▲ Muse 实机界面(图源:App Store)
其产品设计同样有辨识度:整个界面保持极简聊天形态,Agent 执行浏览网页、填写文件、付款审批等任务时,相关结果会直接以卡片形式嵌入聊天流中。
我们因此要求 LongCat 参考 Muse 界面,复刻其主要视觉和交互逻辑,包括 Chat、Ideas、Goals、Connectors 等页面,以及 Browser Card、File Card、Approval Card 等组件,并完整跑通一次电影票预订流程。
从最终效果看,Muse 实机画面中的主要设计元素基本得到保留。

顶部是居中的 Agent 头像,左侧为菜单按钮;聊天区域采用灰色 AI 气泡和浅蓝色用户气泡;Browser Card、文件卡片和支付确认卡片均直接嵌入对话中,底部则保留极简输入框。不仅视觉结构较为接近,几个主要页面也可以实际切换。
在电影票实验中,用户确定场次后,聊天流会出现选座 Browser Card,随后进入支付确认步骤;点击 Allow 后,Agent 继续返回订票结果。

整个流程都在同一聊天界面内完成,与 Muse 的主要交互逻辑基本一致。不过,这项任务的思考时间较长。其中一次连续思考时间达到约 10 分钟,整个项目最终完成耗时也超过 30 分钟。

代码模拟星舰升空,主要动态效果均有实现
第二个任务,选择了刚刚发生的事件。近日,SpaceX 第 14 次星舰试飞从美国得州 Starbase 基地点火升空。
我们要求 LongCat 使用前端代码制作一个实时运行的星舰发射动画,不调用 MP4、GIF 或预渲染视频,主要通过 Three.js、WebGL、Shader 和粒子系统完成火箭、喷流、烟雾、动态光照和镜头运动。
最终项目中,LongCat 用程序化几何体搭建了 Starship 和 Super Heavy,并加入发射塔、发射台和地面设施。

发动机部分使用多个喷流源模拟发动机集群,同时加入火焰;烟雾则分成白色蒸汽、灰色烟雾和贴近地面的尘土三层。项目还实现了动态光照、Camera Shake、镜头上仰、冲击波以及发射状态 UI 等效果。
火箭先在发射台保持静止,随后点火、产生烟雾并缓慢离开发射台,之后逐渐加速,镜头同步向上抬升。从最终画面来看,火箭、发射塔、尾焰、烟雾和镜头跟随等核心元素都已经具备,能够完整实现一次星舰点火升空过程。不过与预期的视觉效果相比,最终成品在场景丰富度、烟雾层次和 3D 材质细节上仍有提升空间。
搭建3D赛车Demo,竞速玩法完整落地
第三个任务,我们让 LongCat 制作一款可以实际游玩的 3D 赛车游戏 Demo。提示词要求项目具备 3 圈比赛、3 辆 AI 赛车、WASD 控制、漂移、氮气、碰撞反馈和 Checkpoint 机制,同时加入排名、速度、圈数、计时器等游戏 UI。最终 Demo 已经可以实际运行。
玩家可以控制赛车完成加速、刹车和转向,AI 车辆也能够沿赛道参与比赛;漂移、氮气、圈数、排名以及计时等基础机制均有实现。

主观体验上,这一任务中 LongCat-2.5-Preview 的速度与完成度低于我们此前体验的 DeepSeek-V4.1-Flash,高于 MiMo-V2.6。
试玩过程中,我们发现了一个控制问题:按 D 键时,赛车实际向左转。LongCat 随后检查代码,将问题定位到 Three.js 坐标系与车辆朝向之间的关系,并耗时 3 分钟修改了 steer 的符号逻辑。

除此以外,赛道本身也相对简单。实际体验中,弯道较多,直道、坡道等路况的区分并不明显。
结语:国模牌桌再添一员,LongCat存在感上来了
三项测试中,LongCat-2.5-Preview 都完成了可实际运行的项目。当天共使用 798.56 万 Token,由于缓存命中不计入资源包消耗,实际扣除约 78.98 万 Token。按照当前 1000 万 Token 免费用的新手礼包,价格优势比较明显。速度方面,三个任务耗时均超过 30 分钟。
相比国内头部模型,LongCat 此前的市场声量并不算高。但这次预览版不仅保留了原生多模态能力,在 Coding 和长任务执行上也已经展现出较完整的能力。
国产模型的竞争正在从参数、榜单延伸到 Coding、Agent、多模态和真实任务执行。LongCat-2.5-Preview 已经给出了一次阶段性答卷,接下来可以关注正式版在速度、稳定性和复杂任务能力上的进一步表现。