找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4257

积分

0

好友

555

主题
发表于 3 小时前 | 查看: 4| 回复: 0

缩小到四分之一,性能却没怎么掉

2760亿参数的模型,实际干活只用120亿,很多任务分数还超过了自己的大哥。Thinking Machines昨天放出了Inkling‑Small,完整权重直接开源。NVIDIA立刻跟进,说这个版本特别适合拿自家硬件微调。

Inkling-Small多模态MoE技术架构与输入模态宣传图

一看到MoE模型,很多人的第一反应是“参数唬人,部署还得堆显卡”。但这一回不太一样。原版Inkling总参数9750亿、激活410亿,Inkling‑Small直接砍到大约四分之一,激活参数只剩120亿,可在编码、推理和多模态上反而维持了接近甚至更好的成绩。上下文依然能撑到100万token。音频、图片、文字一股脑丢进去就能出推理结果,不用额外装任何编码器。

真正有趣的地方在于它并非简单压缩,而是训练配方整体改了——预训练数据配比、蒸馏策略,再加上随后两周的agent式编码强化学习,全都重新调过。结果就是:同样的思考努力下,小模型在部分benchmark上跑赢了大哥。

激活参数砍到三分之一,分数反而上去了?

原来那款大家伙动不动就吃掉几百GB显存,本地跑起来跟搬砖似的。现在激活只有120亿,理论上对硬件友好得多。NVIDIA直接放出NVFP4量化版本,说用两张DGX Sparks就能跑起来,在DGX Station上用NeMo微调也顺手。

打个比方:以前你雇了一位全能秘书,事无巨细全管,薪水高、办公室也大。现在换成精干助理,关键决策自己拍板,琐碎的事情分给专家网络。总编制还在,真正占资源的人却少了。

更重要的是可变思考力度。你可以调节它“想多深”——从几乎不思考到深度推演自由滑动。成本敏感的场景就把努力值压低,需要高精度的地方再拉高。这比固定深度的模型灵活太多了。SWE‑Bench Verified冲到了80.2%,Humanity’s Last Exam文本版31.6%,比原版还略高;音频理解、文档视觉任务也基本持平。

架构上是42层decoder‑only,稀疏MoE,每个token路由到256个专家中的6个,再加2个共享专家。图片切成40×40的patch走层级编码,音频转成离散token,然后一起丢进共享空间。上下文1M,训练用NVIDIA GB300 NVL72。这些细节,对做本地部署的人来说,比参数量本身更关键。

有人会觉得“小模型怎么可能推理超过大模型”。社区里确实有争论——蒸馏加强化学习到底能补上多少知识缺口。SimpleQA这类事实性任务上,小模型掉得比较明显,知识覆盖面还是大模型更稳。

图文音一起推理,本地微调门槛真的降了

以前多模态模型要么分开挂视觉编码器,要么音频链路单独搞。Inkling‑Small把它们嵌进同一套transformer里。图片、音频、文字在输入端就对得整整齐齐,推理时一起算。对于搞agent、文档理解、语音交互的人来说,直接少了一层胶水代码。

实际能干什么呢?理论上,你可以把一段会议录音、几张截图、一段文字说明一起扔进去,让它输出结构化总结或者代码草稿。Tinker平台已经支持直接微调,Hugging Face上放着完整权重和NVFP4版本。许可是Apache 2.0,商用压力也小。

部署路径同样清晰:SGLang、vLLM、Unsloth都有现成recipe。量化后体积降下来,中等规模的本地集群就能扛。NVIDIA特别点名两张DGX Sparks能跑,潜台词是:不用非得等旗舰服务器。

踩过坑的朋友都懂,开源模型权重放出来只是第一步。真正卡人的是推理框架适配、量化精度损失、长上下文稳定性。这次官方和社区几乎同步给出了recipe,至少能帮你省下前两周的摸索时间。你可以优先上BF16追求精度,也可以直接上NVFP4换速度——两种路子都走得通,看你是更在意延迟还是准确率。

训练时用了on‑policy蒸馏,把大模型当老师,再叠两周agent式编码强化学习。这就解释了为啥编码和工具使用分数能顶上来。知识类任务还是原版更稳,小模型更像是“够用且便宜”的那个选项。

怎么上手,以及容易踩坑的地方

先去Hugging Face拉thinkingmachines/Inkling‑Small或NVFP4版本。想快速体验的直接上Tinker Playground,支持文字、图片、音频一起聊。

本地跑的话,vLLM或SGLang的recipe已经写好。量化版本体积更友好,适合先验证流程。微调走Tinker或者NeMo都行。上下文拉到256K以上时,显存和KV cache占用会明显涨,记得提前算好。

⚠️ 注意:音频输入最好控制在两分钟以内,采样率16kHz;图片边长建议在40到4096像素之间,超出后效果可能会掉。

跑完基础推理,建议先在自己的核心场景上实测一遍——编码agent、文档问答、语音指令。分数好看,不代表你的数据分布也一样稳。蒸馏模型偶尔会在边缘case上表现诡异,这算是老生常谈的现象了。

可操作的建议就一条:如果你现在本地已经在跑12B‑30B级别的模型,Inkling‑Small的激活参数和多模态能力绝对值得直接试。硬件够就上BF16,不够就先NVFP4。原版Inkling更适合追求知识覆盖的场景,这个小版本更适合高频、成本敏感的agent工作流。

参数少了,思考还在。真正决定体验的,还是你怎么调那个努力值。在云栈社区,已经有一批老司机在实际项目中磨合这套方案了,踩坑经验比官方文档还细致,欢迎来聊聊你的配置。你本地会先上量化版还是直接上全精度?💬




上一篇:OpenMAIC 实战教程:多智能体AI课堂一句话生成挂谷猜想教学
下一篇:马斯克辟谣特斯拉剥离中国业务传言,豆包大模型登陆国内车型
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-8-2 07:28 , Processed in 0.998068 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表