為 AI 時代換一台 M5 Max:新舊 Mac 跑 Local LLM 的初步比較
這陣子我換了一台新的 Mac,規格是 MacBook Pro M5 Max / 128GB RAM。 這不是一個很輕鬆的決定, 畢竟這台蠻貴的,而且原本的電腦也還能用沒有壞。 可是最近幾個因素疊在一起,讓我覺得說服自己進行這次的升級。
為 AI 時代換一台 M5 Max:新舊 Mac 跑 Local LLM 的初步比較

這陣子我換了一台新的 Mac,規格是 MacBook Pro M5 Max / 128GB RAM。 這不是一個很輕鬆的決定, 畢竟這台蠻貴的,而且原本的電腦也還能用沒有壞。 可是最近幾個因素疊在一起,讓我覺得說服自己進行這次的升級。
第一個原因當然是 AI。 這一年 local LLM 的進展非常快, Ollama、LM Studio、MLX 這些工具已經讓本機跑模型變成日常可行的事情。 以前我會覺得基本上寫程式跟基本事務都是靠雲端模型, 但現在情況有點不同了: 一來雲端服務的價格跟用量限制都變得不太可控, 一下大,一下小, 但是仍然有漲價的趨勢感。 此外本地端的 coding model、reasoning model、vision-language model 都在進步,本機能跑的模型似乎越來越接近「可用」的狀況。
第二個原因是 RAM。 最近記憶體價格大漲,讓我有一種奇妙的壓力: 如果未來 AI 越來越吃記憶體, 那現在買大 RAM 版本可能不是奢侈, 因為可能之後同樣的價格已經買不到這樣大小的記憶體了。
這篇不是開箱文, 並不是嚴格的實驗論文。 比較像是我給自己的紀錄跟驗證: 這次升級,到底在 local LLM 上有沒有感?
測試方式
我利用 codex 寫了一個簡單的 benchmark script, 透過 Ollama 跑幾組固定 prompt,記錄:
time to first token
total latency
output tokens/sec
prompt processing tokens/sec
每輪 run 的穩定性
測試的兩台機器是:

這次先測純文字 local LLM,不測 vision。 原因是我主要想知道「新舊電腦跑本地模型的速度差距」, vision 會多出圖片解析度、encoder、OCR 品質等變因, 之後有需要再另外測。
測試模型包括:
gemma4:e4b
gemma4:26b
qwen3.5:35b-a3b-coding-nvfp4
qwen3.6:35b
其中我最在意的是後兩個:
qwen3.5:35b-a3b-coding-nvfp4 應該適合 local coding agent;
qwen3.6:35b 則比較像高階泛用模型壓力測試。
測試結果
平均四組 prompt 的 median wall_output_tok_s 大概是:

M5 Max 對 M4 Pro 的提升,大概落在 1.7x 到 2.0x。 而且模型越重、越 dense,差距越大。
qwen3.6:35b 是最明顯的例子。
舊電腦大約 30 tok/s,新電腦大約 61 tok/s,幾乎就是兩倍。
qwen3.5:35b-a3b-coding-nvfp4 則是另一個驚喜。
它在舊 Mac 上已經有 73 tok/s,在新 Mac 上跑到 132 tok/s。
這代表這類 MoE / low active parameter / NVFP4 的模型,
真的很適合本地 coding 使用。 速度很快,而且延遲很低。
Gemma 4 的結果也很有趣。
gemma4:e4b 和 gemma4:26b 幾乎一樣快,
兩台機器上都呈現類似現象。
這可能代表這條模型/runner 路徑的瓶頸不完全在模型大小,
或是 MoE active parameter 讓 26B 的推理成本沒有想像中高。
從 Benchmark 看來, 對我來說,這次測試讓升級有了實感!
local LLM 這件事, 它的價值不只是速度。 它也代表:
- 可以離線工作
- 可以處理比較私密的資料
- 可以不用每件小事都打到雲端 API
- 可以把 AI workflow 當成自己機器的一部分,而不是外部服務
當然,雲端模型還是更強。 Local LLM 目前確實不能取代 GPT-5.5 或 Claude 這些服務。 但當我雲端 AI 用量暫時用完, 或者想處理私密資料, 或暫時在 local 跑個服務例如用 AI 幫我產生學習日文的例句, 我都可以在我本機順暢完成。
僅管效能變快, 但 Codex/Claude 還是會提醒我, M5 Max 不是魔法。 它不能讓所有模型都突然變成雲端旗艦等級。 它只是讓本來「勉強可用」的東西變得更接近「順手」, 讓本來「要等一下」的模型變成「可以互動」。
總結來說, M5 Max / 128GB 對 local LLM 是有明顯提升的。 相對 M4 Pro / 48GB,這次測到的提升大約是:
- 輕量或 MoE 模型:約 1.7x 到 1.8x
- dense 35B 模型:約 2.0x
如果只是日常文書、瀏覽器、一般 coding, 這當然不是必要升級。 但如果我們開始把 local LLM、coding agent、長 context、私有資料推理當成未來幾年的工作重心, 那麼應該可以考慮一下這台或更高階的個人用電腦。
我並不確定這是不是「最划算」的選擇, 不過總之, 接下來我個人用的電腦就會是這台 M5 Max 了! 請多指教, 別讓我太失望!
測試 script 與原始結果我也整理放在 GitHub: https://github.com/ddsakura/aibenchmark
PS: 目前還只是初步 benchmark, 後續可能會再加入:
vision model
long context
MLX vs Ollama
power / thermal
agent workflow benchmark
等比較貼近日常 AI workflow 的測試。
메타데이터
- post_id
- 78943dafa6b6
- slug
- 為-ai-時代換一台-m5-max-新舊-mac-跑-local-llm-的初步比較-78943dafa6b6
- url
- https://medium.com/ddsakura-blog/%E7%82%BA-ai-%E6%99%82%E4%BB%A3%E6%8F%9B%E4%B8%80%E5%8F%B0-m5-max-%E6%96%B0%E8%88%8A-mac-%E8%B7%91-local-llm-%E7%9A%84%E5%88%9D%E6%AD%A5%E6%AF%94%E8%BC%83-78943dafa6b6
- canonical_url
- https://medium.com/ddsakura-blog/%E7%82%BA-ai-%E6%99%82%E4%BB%A3%E6%8F%9B%E4%B8%80%E5%8F%B0-m5-max-%E6%96%B0%E8%88%8A-mac-%E8%B7%91-local-llm-%E7%9A%84%E5%88%9D%E6%AD%A5%E6%AF%94%E8%BC%83-78943dafa6b6
- author_url
- https://medium.com/@ddsakura
- status
- ok
- fetched_at
- 2026-06-12 07:40:50