← Back to list

為 AI 時代換一台 M5 Max:新舊 Mac 跑 Local LLM 的初步比較

這陣子我換了一台新的 Mac,規格是 MacBook Pro M5 Max / 128GB RAM。 這不是一個很輕鬆的決定, 畢竟這台蠻貴的,而且原本的電腦也還能用沒有壞。 可是最近幾個因素疊在一起,讓我覺得說服自己進行這次的升級。

ddsakura in 賽拉維的秋天 — ddsakura.blog · 2026-05-16 02:45 · 0 claps · 4.8 min read
#macbook-pro #m5-max #local-llm #benchmark #programming
Open on Medium ↗
Wiki topics: LLM · Large Language Models EVAL · Evaluation & Benchmarks 💻 · Programming

為 AI 時代換一台 M5 Max:新舊 Mac 跑 Local LLM 的初步比較

這陣子我換了一台新的 Mac,規格是 MacBook Pro M5 Max / 128GB RAM。 這不是一個很輕鬆的決定, 畢竟這台蠻貴的,而且原本的電腦也還能用沒有壞。 可是最近幾個因素疊在一起,讓我覺得說服自己進行這次的升級。

第一個原因當然是 AI。 這一年 local LLM 的進展非常快, Ollama、LM Studio、MLX 這些工具已經讓本機跑模型變成日常可行的事情。 以前我會覺得基本上寫程式跟基本事務都是靠雲端模型, 但現在情況有點不同了: 一來雲端服務的價格跟用量限制都變得不太可控, 一下大,一下小, 但是仍然有漲價的趨勢感。 此外本地端的 coding model、reasoning model、vision-language model 都在進步,本機能跑的模型似乎越來越接近「可用」的狀況。

第二個原因是 RAM。 最近記憶體價格大漲,讓我有一種奇妙的壓力: 如果未來 AI 越來越吃記憶體, 那現在買大 RAM 版本可能不是奢侈, 因為可能之後同樣的價格已經買不到這樣大小的記憶體了。

這篇不是開箱文, 並不是嚴格的實驗論文。 比較像是我給自己的紀錄跟驗證: 這次升級,到底在 local LLM 上有沒有感?

測試方式

我利用 codex 寫了一個簡單的 benchmark script, 透過 Ollama 跑幾組固定 prompt,記錄:

time to first token
total latency
output tokens/sec
prompt processing tokens/sec
每輪 run 的穩定性

測試的兩台機器是:

這次先測純文字 local LLM,不測 vision。 原因是我主要想知道「新舊電腦跑本地模型的速度差距」, vision 會多出圖片解析度、encoder、OCR 品質等變因, 之後有需要再另外測。

測試模型包括:

gemma4:e4b
gemma4:26b
qwen3.5:35b-a3b-coding-nvfp4
qwen3.6:35b

其中我最在意的是後兩個: qwen3.5:35b-a3b-coding-nvfp4 應該適合 local coding agent; qwen3.6:35b 則比較像高階泛用模型壓力測試。

測試結果

平均四組 prompt 的 median wall_output_tok_s 大概是:

M5 Max 對 M4 Pro 的提升,大概落在 1.7x 到 2.0x。 而且模型越重、越 dense,差距越大。

qwen3.6:35b 是最明顯的例子。 舊電腦大約 30 tok/s,新電腦大約 61 tok/s,幾乎就是兩倍。

qwen3.5:35b-a3b-coding-nvfp4 則是另一個驚喜。 它在舊 Mac 上已經有 73 tok/s,在新 Mac 上跑到 132 tok/s。 這代表這類 MoE / low active parameter / NVFP4 的模型, 真的很適合本地 coding 使用。 速度很快,而且延遲很低。

Gemma 4 的結果也很有趣。 gemma4:e4bgemma4:26b 幾乎一樣快, 兩台機器上都呈現類似現象。 這可能代表這條模型/runner 路徑的瓶頸不完全在模型大小, 或是 MoE active parameter 讓 26B 的推理成本沒有想像中高。

從 Benchmark 看來, 對我來說,這次測試讓升級有了實感!

local LLM 這件事, 它的價值不只是速度。 它也代表:

  • 可以離線工作
  • 可以處理比較私密的資料
  • 可以不用每件小事都打到雲端 API
  • 可以把 AI workflow 當成自己機器的一部分,而不是外部服務

當然,雲端模型還是更強。 Local LLM 目前確實不能取代 GPT-5.5 或 Claude 這些服務。 但當我雲端 AI 用量暫時用完, 或者想處理私密資料, 或暫時在 local 跑個服務例如用 AI 幫我產生學習日文的例句, 我都可以在我本機順暢完成。

僅管效能變快, 但 Codex/Claude 還是會提醒我, M5 Max 不是魔法。 它不能讓所有模型都突然變成雲端旗艦等級。 它只是讓本來「勉強可用」的東西變得更接近「順手」, 讓本來「要等一下」的模型變成「可以互動」。

總結來說, M5 Max / 128GB 對 local LLM 是有明顯提升的。 相對 M4 Pro / 48GB,這次測到的提升大約是:

  • 輕量或 MoE 模型:約 1.7x 到 1.8x
  • dense 35B 模型:約 2.0x

如果只是日常文書、瀏覽器、一般 coding, 這當然不是必要升級。 但如果我們開始把 local LLM、coding agent、長 context、私有資料推理當成未來幾年的工作重心, 那麼應該可以考慮一下這台或更高階的個人用電腦。

我並不確定這是不是「最划算」的選擇, 不過總之, 接下來我個人用的電腦就會是這台 M5 Max 了! 請多指教, 別讓我太失望!

測試 script 與原始結果我也整理放在 GitHub: https://github.com/ddsakura/aibenchmark

PS: 目前還只是初步 benchmark, 後續可能會再加入:

vision model
long context
MLX vs Ollama
power / thermal
agent workflow benchmark

等比較貼近日常 AI workflow 的測試。


메타데이터
post_id
78943dafa6b6
slug
為-ai-時代換一台-m5-max-新舊-mac-跑-local-llm-的初步比較-78943dafa6b6
url
https://medium.com/ddsakura-blog/%E7%82%BA-ai-%E6%99%82%E4%BB%A3%E6%8F%9B%E4%B8%80%E5%8F%B0-m5-max-%E6%96%B0%E8%88%8A-mac-%E8%B7%91-local-llm-%E7%9A%84%E5%88%9D%E6%AD%A5%E6%AF%94%E8%BC%83-78943dafa6b6
canonical_url
https://medium.com/ddsakura-blog/%E7%82%BA-ai-%E6%99%82%E4%BB%A3%E6%8F%9B%E4%B8%80%E5%8F%B0-m5-max-%E6%96%B0%E8%88%8A-mac-%E8%B7%91-local-llm-%E7%9A%84%E5%88%9D%E6%AD%A5%E6%AF%94%E8%BC%83-78943dafa6b6
author_url
https://medium.com/@ddsakura
status
ok
fetched_at
2026-06-12 07:40:50