上周我做了一件稍微有点疯的事——把基础款 M4 Mac mini 里所有 AI 模型全删了,整整 39GB,一个不留。然后从零开始。接下来几个晚上,我又干了件更疯的事:在同一台小小的 599 美元基础款 Mac mini 上,一个接一个地下载、测试本地 AI 模型。目的只有一个:苹果最便宜的 Mac,到底有哪些本地 AI 值得长期留下来?
结果,大多数模型都不怎么样。有的太胖,16GB 内存根本塞不下;有的慢到无法正常使用;还有一些,单纯就是不够聪明。但最后有 9 个模型,真的让我坐直了身体,然后冒出一句:
“等等,我这台 mini 居然能干这个?”
更重要的是:这 9 个全部可以完全离线运行。没有云端,没有月费,不用登录账号,你的数据不会离开桌面上的这台机器。在云栈社区里大家经常争论 16GB 机器的本地 AI 上限,这篇实测或许能给出一些具体答案。
接下来你看到的每一个数字,都是我在同一台基础款 16GB M4 Mac mini 上亲自测出来的。测试时我把后台应用都关了,所以这些数据可不是拿 64GB Mac Studio 测完又假装是 Mac mini 的“漂亮数字”。为什么这一点很重要,后面马上说。先看看最后留下来的这 9 个。
开始之前先说句实话,不看这段,后面你可能会骂我
16GB 很紧,真的很紧。
所以:一次只跑一个重模型。 你可以把它想象成一个只有一条操作台的小厨房,而不是自助餐厅。加载一个聊天模型,用完,关闭,然后再加载图像模型。如果你非要两个大模型一起跑,整台机器很快就会开始喘。
还有一个很重要的问题:网上你搜到的大部分所谓“M4 Mac mini AI Benchmark”,背后其实偷偷用的是 M4 Pro 或者 Mac Studio。这些机器拥有基础款 M4 2 到 4 倍的内存带宽,所以那些 Token/s 数字看起来很爽,但放到基础款 M4 上经常就是幻想。下面所有数据都是在真正的基础款 M4 上测的。这份真实,才是整篇文章存在的意义。
基础款 16GB M4 Mac mini 实测 Tokens/sec,截图由作者提供——真机基础款 M4,不是 M4 Pro。
好了?那开搞。
这篇文章包含什么?
- 最好的全能隐私聊天模型,你的离线 ChatGPT;
- 最好的本地编程助手;
- 最适合总结长文档、网页和 YouTube 的模型;
- 最好的本地文件聊天方案,私有 RAG;
- 最好的离线翻译模型;
- 最好的本地图像生成器,你的免费 Midjourney;
- 最好的截图/视觉理解模型,顺便还能 OCR;
- 最好的离线语音转文字模型,速度快过实时播放;
- 最好的文字转语音 + 声音克隆工具;
- Bonus:目前这台 mini 仍然干不了的一件事。
大脑:文本模型
1 你的离线 ChatGPT:Qwen3.5–9B
我一直不太喜欢一个想法:自己凌晨两点那些半成品、没头没尾的问题,要永久躺在某家公司服务器上。所以我第一件想解决的事情,就是找一个真正能在 Wi-Fi 关闭的情况下正常聊天的本地模型。最后的赢家是:Qwen3.5–9B。
模型大小:6.6GB。它不会把 16GB 内存彻底吃干净,还能给系统留出不少余量。在我的 Mac mini 上,它的生成速度能达到 18 tokens/sec——这个速度已经舒服到比你正常阅读还快。
我给它出了个题:让它像一个嘴有点贫的共同作者一样,解释为什么 16GB Mac mini 能跑 90 亿参数模型,却容易在 300 亿模型面前扑街。它的回答非常到位:
“把你的 RAM 想象成厨师的操作台。16GB 足够你舒服地处理一道只有九种食材的菜,但如果你同时要摆弄三十种香料,桌子立刻就满了。你甚至开始掉工具,只为了不把东西全部碰翻。更大的空间,不只是让厨师干得更卖力,而是让他有空间处理更复杂的东西。”
是不是有点离谱?这可是完全本地运行。
如果你想要一个更大的脑子,gpt-oss:20b 也能塞进去。这是 OpenAI 的开放模型,几乎是 16GB 内存能够强行塞进去的最聪明级别之一,速度可以达到 24 tok/s。但问题也来了:它会先“想”很久再正式回答,我亲眼看它在一个问题上烧掉大约 1,300 个推理 Token。所以即使 Token/s 很快,体感还是会变慢。这也是本地模型里一个特别容易被忽略的问题:大,不等于好用。
日常聊天,我认为 Qwen3.5–9B 是甜点位。如果只是要极快的一句话回答,可以降到 Llama 3.2 3B,速度能冲到 48 tok/s,非常夸张。
怎么运行?
可以用 LM Studio,免费。安装:
brew install --cask lm-studio
你可以把它理解成一个专门运行本地模型的 ChatGPT 窗口。
喜欢 Terminal 的,可以用 Ollama:
brew install ollama
如果想把 gpt-oss 硬塞进 16GB,还可以配合之前文章里提到的 Wired Memory 技巧:
Your Mac Mini Is Hiding RAM — Here's the One Terminal Command to UNLOCK It
让同样的硬件装下更大的 LLM。某种程度上,不是 Mac 没有内存,而是 macOS 对可用于模型的内存有自己的保守策略。
2 永远不离开 Mac 的编程搭档:qwen2.5-coder-7B
这一项我不想吹得太过头,因为别人已经吹得够多了。在 16GB 内存上,你基本跑不了真正意义上的“大型 Agentic Coding Model”。那些真正厉害的通常是 30B+,根本塞不下。如果有人告诉你“16GB 随便跑”,那他八成安静地坐在一台 64GB 机器前面。
不过,16GB 可以非常舒服地运行 qwen2.5-coder-7B。模型大小 4.7GB,速度 22.7 tok/s。它特别适合写代码片段、自动补全、小功能、工具函数、修复局部 Bug。
我让它写一个“找出文件夹里最大的几个文件”,它直接给了我一段干净、能跑的 Python。没有来回确认,没有手把手带。它生成了一个 largest_files(folder, n=5) 函数,会:
- 使用
os.walk 递归遍历目录;
- 把文件大小格式化为 MB;
- 自动跳过抛出
PermissionError 的文件;
- 按从大到小排序;
- 返回最大的 N 个文件。
截图由作者提供。
最爽的是:坐飞机也能用,完全不联网。但别要求它“帮我把整个 Repo 重构一遍”,那基本已经进入 24GB+ 内存 应该处理的任务了。而且说句现实的:即便你能跑起来,它也还不是 Claude。所以本地 Coding Model 最大的价值,不一定是代替云端最强模型,而是把那些局部、高频、隐私敏感的 Coding 任务留在本机。
3 总结一切:长 PDF、网页、YouTube——Qwen3.5–9B
又是 Qwen3.5–9B,只是这次它换了顶帽子。把一大坨文本扔进去,它负责给你提炼重点。
真正的限制其实不完全来自模型,而是内存。那些模型页面上动不动写“256K Context!”,在 16GB Mac mini 上更多属于理论上限。现实里真正舒服可用的上下文大概在 8K 到 32K Tokens,再长内存就开始顶不住。所以遇到超长 Transcript 或大文档,最好还是做 Chunk。
我把一份乱七八糟的 Standup Meeting Transcript 丢给它,让它整理:“提取三个 Action Item,并标出 Owner。”结果:
- Renew CI certificate——Marco;
- Write onboarding copy——Sam;
- Email beta testers regarding delay——Priya。
不性感,但极其有用。而且最好玩的地方是:你可以串起来用。先用后面的 #8 把会议录音转成文字,然后直接把 Transcript 喂给 Qwen3.5–9B,一小时的废话最后变成一张 To-do List,全程离线。这才是真正实用的本地 AI Workflow。
如果特别在意复杂报告里的事实忠实度,可以考虑 Gemma 4 12B,它稍微更准一点,但速度也会更慢一点。
你自己的数据
4 只认识你自己文件的私人 ChatGPT:本地 RAG
这个东西让我一个朋友看完直接说:
“好吧,这已经有点像巫术了。”
玩法很简单:你把一堆 PDF、Note、文档扔进一个 App,然后直接开始提问,问的全是你自己的资料,而且任何内容都不会上传到云端。
底层其实有两个模型在工作。一个负责聊天:Qwen3.5–9B;另一个是很小的 Embedding Model:Qwen3-Embedding-0.6B。真正负责“帮我找出最相关的那一段”的,就是后者。我的快速测试里,相关问题相似度 0.72,不相关问题 0.34,这种区分度正是你希望看到的。
最爽的地方在于:你根本不需要碰底层这些东西。可以直接安装 RecurseChat,价格 19.99 美元一次性买断,Mac App Store。把 PDF 拖进去,直接问,答案甚至会给你对应的源文件页码引用。
如果不想付钱,也有免费的方案:LM Studio 的 Document Chat,或者 AnythingLLM。
不过它有一个真实限制:对于“帮我找到并引用某个具体信息”,它非常强;但如果你要求“综合几十份文档,总结出跨文档规律”,能力就没那么稳。还有:纯图片扫描 PDF 需要先 OCR。而非常巧的是,这正好就是 #7 要解决的问题。
5 完全离线、私密翻译:Gemma 4 12B,或者直接用苹果自带的
如果只是出国旅行问几句简单表达,macOS 26 自带的 Apple Translate 已经支持离线,下载语言包就行,而且免费。但如果你真正关心的是语气,那么本地 LLM 会比传统翻译 App 更“像人说话”。
我给 Gemma 4 12B 一段带点烦躁情绪的英文,然后要求它翻成一个朋友平时真的会发出来的那种语气。原文:
“Ugh, my laptop fan sounds like a jet engine again. Think it's finally dying, or is it just the 47 Chrome tabs?”
它翻成法语时开头直接来了句 “Pfff……”,最后译成:
“Pfff, mon ordi fait un bruit de moteur d'avion encore une fois… ou c'est juste mes 47 onglets Chrome ?”
这个 Pfff 真的是点睛之笔,教科书式翻译器很少会这么翻。Gemma 4 12B 在基础款 M4 Mac mini 上通过 Ollama 完全离线运行,速度 13.3 tok/s,截图由作者提供。
更好用的一点是:它可以一次完成翻译 + 总结。直接把一篇外语文章丢进去,让它给你翻完顺便提炼重点。如果是比较稀有的语言,可以使用 MADLAD-400,覆盖 400+ 语言。当然,如果只看主流欧洲语言的流畅度,DeepL 依然很强。但它们不是每一个都能做到:把 Wi-Fi 拔掉,在你厨房桌子上的 Mac mini 里继续跑。这就是本地的意义。
感官:图像、视觉、声音
6 你的免费离线 Midjourney:FLUX.2 klein
今天你可以先取消一个订阅。FLUX.2 klein 可以在本地免费生成质量真的不错的图片,而且它的 License 甚至允许商业使用。
我在基础款 Mac mini 上测试的是 4-bit 和 4 Steps。生成速度:512×512 大约 18 秒/张,1024×1024 大约 57 秒/张。而最让我意外的是:完整 1024×1024 居然没有爆内存。网上一半的人都在说“16GB 不可能”,结果它就是跑完了。当然第一次启动会比较慢,因为需要加载模型,加载之后就顺畅很多。
最好用的地方是:安装几乎没有门槛。直接用 Draw Things,Mac App Store 免费,而且针对 Apple Silicon 做了优化。输入 Prompt,点 Generate,然后看着你的 Mac 开始画画。
这是它给我生成的一张:1024×1024,大约 57 秒,完全本地生成。原始 Prompt:
a minimalist editorial illustration of a single glowing Mac mini on a wooden desk at dusk, warm amber light spilling out, deep teal-to-navy gradient background, soft film grain, lots of negative space, cinematic.
需要避开的坑:FLUX.2 dev 需要 64GB,别想了;Sana 官方直接不支持非 NVIDIA GPU,所以 Mac 上就不要跟它死磕。真正适合基础款 mini 的是 klein。这再次说明:本地 AI 不是永远追最大模型,而是找最适合你的模型。
7 “嘿 Mac,帮我看一下这张截图”:Qwen3-VL-4B
这个真的有点像作弊。丢一张 Screenshot、Receipt、Chart、Menu 或照片进去,它直接读。我的选择是 Qwen3-VL-4B,大小 3.3GB,而且是我测试过的视觉模型里速度最快的之一:31.7 tok/s。关键是准确度还非常好。
我先给了它一张 Receipt,所有商品行都识别正确,最终 Total 也是 21.16。然后我又给它一张 Bar Chart,Prompt 里没有告诉它任何数字,它直接回答:
“这个柱状图展示的是每月活跃用户数,单位是千。最高是五月,90 千;最低是一月,40 千。”
完全正确。它真的读懂了图表。
最爽的是:同一个模型既可以做普通视觉理解,也能做 OCR。也就是说,它能从扫描页面、手写笔记、拍照的路牌、菜单里直接提取文字。如果再和刚才的 #5 串起来:拍一张国外菜单 → OCR → 翻译 → 解释,你就得到了一台完全离线的“拿相机对着外语菜单就能看懂”的机器。
运行方式:LM Studio。Mac 上尽量使用 MLX Build,这样 Vision 才能正常工作。如果要认真做文档数字化,特别是表格和数学公式,还可以加 olmOCR 2。
8 几小时音频,本地转录速度比实时播放还快:Parakeet
如果整篇文章你只记住一件事,我建议记这个:Mac 本地语音转录,比很多付费服务又快又好,而且不联网。
冠军是 NVIDIA 的 Parakeet TDT 0.6B v3。我在基础款 mini 上测到 16.9× Real-time。什么意思?就是1 小时音频大约 3 分半钟转完,而且 Transcript 几乎完美。我是在短音频上测试速度,不过更长文件里这个倍率基本还能保持。
另一个选择是 OpenAI 的 Whisper large-v3-turbo,速度 9.4× Real-time,它在非欧洲语言上通常会更有优势。
最好的地方是:如果你根本不想碰 Terminal,可以直接使用 MacWhisper 或者 superwhisper。它们都把模型封装进了简单的 GUI,拖一个文件进去,或者让它监控整个文件夹,然后批量转录,全部在本地完成。如果喜欢 Terminal,可以:
brew install whisper-cpp
免费路线就搞定了。
这个能力几乎所有人都用得上:会议、课程、Voice Memo、采访、Podcast,以及那种你根本不想听完 45 分钟只想扫一眼文字的音频。然后别忘了:把 Transcript 喂给 #3。于是:音频 → 转文字 → 总结 → 提取 Action Item,整条链路都在 Mac 上完成。是不是开始有点离谱了?
Parakeet 在大约 3.5 分钟内转录一小时音频,完全离线,截图由作者提供。这是一段 29 秒的会议录音,我把它交给在基础款 16GB M4 Mac mini 上完全离线运行的 NVIDIA Parakeet TDT。
9 给你的 Mac 一张嘴,顺便还能克隆声音:Kokoro & Chatterbox
最后一个,来点好玩的。你的 Mac mini 可以说话,甚至有点让人不安的是:它还可以用别人的声音说话。
如果只是 Text-to-Speech,我推荐 Kokoro。这是一个小得夸张的模型:8200 万参数,大小 约 0.3GB,Apache License。但声音自然度高得不像这么小的模型。在我的 mini 上,它生成语音的速度可以达到 2.9× Real-time,也就是生成速度比人真正说话的速度还快。
最简单的 App:Kokori,一个免费的 Menu Bar App,底层就是 Kokoro。
如果想做 Voice Cloning,可以用 Chatterbox,MIT License。只需要几秒钟 Reference Audio,它就能模仿一个人的声音,而且真的有效。这也是为什么它听起来既神奇又有一点让人背后发凉。
不过先提醒一下:在 16GB Mac mini 上,Chatterbox 很慢。我的一次 Voice Clone,生成 6 秒语音大约用了 2 分钟。所以这是一个适合耐心玩家的 Hobby,不是“点一下立刻出结果”的 Party Trick。
最好玩的玩法,依然是把模型串起来:用 #3 总结长文章,再用 #9 把总结念出来。然后你就得到了一个完全私有、完全离线的个人 Podcast。去散步的时候手机揣兜里听,原始文章根本不需要上传到任何服务器。这种组合能力,才是本地 AI 真正开始变有意思的地方。
Bonus:还有一件事情,这台 mini 现在确实干不了
我前面说了要真实,所以这里也不藏。目前基础款 16GB M4 Mac mini 仍然有一个明显边界:本地 AI 视频 + 声音生成。比如 LTX-2.3,这种模型真正舒服运行需要超过 16GB 的内存,现实一点说 32GB Mac 才比较合适。效果非常惊艳,甚至这也是为什么我下一次升级设备大概率不会优先考虑 iPhone。但在基础款 mini 上,这里就是墙,别硬撞。
然而除了这一项之外,前面列出来的所有事情,你今天手上这台 599 美元的机器基本都可以完成。
最后的真实结论
有 91 个模型没有通过我的筛选,最后留下了这 9 个。而当它们组合起来之后,苹果最便宜的 Mac 已经可以变成一台真正意义上的私人 AI 工作站。它可以聊天、写代码、总结、读取你的私人文件、翻译、画图、看懂图片、做 OCR、转录语音、生成语音,甚至克隆声音。而且这些事情全部可以做到:离线、免费、数据属于你自己。没有云服务,没有每个月继续扣费,也没有哪个第三方服务器需要知道你昨晚问了 AI 什么问题。
当然,16GB 依然不是魔法。你需要控制模型大小,一次只运行一个重量级模型,接受有些模型必须降量化,接受视频生成仍然需要更多内存。但真正让人惊讶的不是“这台 599 美元 Mac mini 能不能打赢 64GB 工作站”,答案当然不能。真正让人惊讶的是:一台原本很多人准备拿去当 NAS、媒体服务器或者家庭小主机的基础款 Mac mini,现在已经能独立完成如此完整的一套 AI 工作流,而且全程不用把自己的数据交出去。
这样想想:599 美元,好像确实有点离谱。