搭載全新 M5 Ultra 處理器的 Mac Studio 正式推出,作為 Apple 旗下最強大的桌面級工作站,今代不單將官方記憶體頻寬提升至 1.2TB/s,GPU 更於每個核心新增神經網絡加速器(Neural Accelerator),並配備全新著色器核心(Shader Core)、第二代動態快取(Dynamic Caching)以及應用了全新晶片封裝架構(UltraFusion),加上讀寫速度分別高達 13.76GB/s 及 11.35GB/s (我們今次實測速度)的極速 SSD,帶來全面的效能提升。不過對於專業用戶與開發者而言,最關心的莫過於大容量統一記憶體(Unified Memory)的實戰能力。今次我們將會進行深度實測,以 MTPLX 環境挑戰 Qwen 3.8 27B 以及高達 125B 參數的 Qwen 3.8 Flash-Next 等本地 AI 大型語言模型(Local LLM),從生成速度、回應延遲(TTFT, 首字回應時間)、記憶體頻寬以至功耗,全面剖析 M5 Ultra 運行 Local AI 的真實實力,並探討 M3 Ultra 用家到底值不值得升級!
相關影片:



同樣 256GB RAM 大型 Local LLM 是否真正夠快?
Apple Silicon 跑 Local LLM,一直有統一記憶體(Unified Memory)容量夠大的優勢,但「模型放得入」與「真正好用」是兩回事。今次我們以同樣配備 256GB 統一記憶體、4TB SSD 的 Mac Studio M3 Ultra 與 M5 Ultra 比較,重點不是單看 CPU、GPU 跑分,而是實際跑大型語言模型時,生成速度、回應延遲、記憶體頻寬及功耗有多大分別。


結果相當明顯:M5 Ultra 跑 Qwen 3.8 27B 快約四成;Qwen 3.8 Flash-Next 更由 M3 Ultra 的 69.4 tok/s 提升至 M5 Ultra 的 115 tok/s。對 Local AI 而言,新一代 Mac Studio 已不只是「可以裝下大型模型」,而是開始將高能力模型推到相當流暢的速度。


▲ M5 Ultra 跑 Qwen 3.8 Flash-Next,今次主要測試錄得 115 tok/s,另外兩次相近測試亦有 116 及 118 tok/s。
兩款模型差異很大 36GB Dense 對 109GB MoE
今次使用 MTPLX 作為 Local LLM 運行環境。為了全面評估,我們挑選了兩款架構截然不同的熱門開源模型來進行壓力測試。

第一款 Qwen 3.8 27B Optimized Quality(動態 8-bit)是 27B Dense 模型,即傳統的密集型神經網絡,運算時會調用所有參數。MTPLX 版本採用 Dynamic 8-bit,取向較重視保留模型品質。Dashboard 顯示,M3 Ultra 測試時約使用 36.1GB 統一記憶體,M5 Ultra 則為約 33.7GB。

第二款 Qwen 3.8 Flash-Next Optimized Speed(Dynamic 4-bit, Sparse Attention 8-bit)則是大型 125B-A6B MoE 混合專家模型,運算時只會根據需求啟用部分參數以提高效率。主語言模型有 125B 參數,而每個 token 約啟用 6B;MTPLX 版本主要採用 Dynamic 4-bit,Sparse Attention projection 保留 8-bit。今次兩機測試均使用約 109GB 記憶體。Qwen 官方亦另列 51B n-gram embedding 及 MTP,因此 125B 是主語言模型規模,而非整個套件所有參數的簡單總和。
▲ M3 Ultra 跑 Qwen 3.8 27B Optimized Quality 時,Dashboard 顯示約使用 36.1GB 記憶體。
▲ M5 Ultra 跑 Qwen 3.8 Flash-Next Optimized Speed 的相近測試畫面,記憶體使用量約 109.4GB。
| 模型 | 架構 / 設定 | 測試記憶體佔用 |
|---|---|---|
| Qwen 3.8 27B Optimized Quality | 27B Dense Dynamic 8-bit |
M3 Ultra:約 36.1GB M5 Ultra:約 33.7GB |
| Qwen 3.8 Flash-Next Optimized Speed | 125B-A6B MoE Dynamic 4-bit Sparse Attention 8-bit |
M3 Ultra:約 109.6GB M5 Ultra:約 109.4GB |
▲ 今次測試同時涵蓋約 34–36GB 的 27B Dense 模型,以及記憶體佔用超過 100GB 的大型 MoE 模型。
用 Python Debug 題比較 避免只測「Gen 文」
很多人測試 AI 只會叫它寫篇短文,但這無法反映專業用戶的真實高強度需求。為了增加測試難度和實用性,測試採用一條改編自 LeetCode Hard「Reverse Nodes in k-Group」的 Python Debug 題,程式預先加入兩個真正邏輯 Bug,要求模型理解程式、找錯並完整修正。題目有標準答案,較單純要求模型生成長文更接近 Coding 工作負載。
兩機均使用新 Session、Cache Miss、MTP Depth 3 及 Reasoning Auto。今次屬單一短上下文 Debug workload,大部分配置以一筆主要紀錄比較;M5 Ultra Flash-Next 額外有兩筆相近結果。由於每次回答輸出長度並不相同,因此主要比較 generation tok/s,而不是整次回答完成時間。
▲ M3 Ultra 跑 27B 的 Debug 回答畫面,可看到模型對程式錯誤的分析及修正。
▲ M5 Ultra 的 27B 測試結果及執行狀態;今次主要以生成速度作兩代平台比較。
27B 快 42% Flash-Next 更快 66%
進入最核心的效能對決,我們實際比較了兩部主機在處理剛才的 Python Debug 題目時,到底能有多快的文字生成速度。首先在較輕量的 27B 級別測試中,Qwen 3.8 27B 在 M3 Ultra 錄得 56.4 tok/s,M5 Ultra 達 80.3 tok/s,效能提升達到 42.4%;開始生成首個 token 的 TTFT(Time To First Token,即按下 Enter 後到 AI 開始打字的反應等待時間)亦由 M3 Ultra 的 1.50 秒降至 M5 Ultra 的 0.54 秒。
測試 1(Qwen 3.8 27B):
▲ M3 Ultra 跑 Qwen 3.8 27B,主要測試錄得 56.4 tok/s。
▲ M5 Ultra 同一款 27B 模型錄得 80.3 tok/s,比 M3 Ultra 提升約 42%。
面對中型模型,M5 Ultra 已經表現出極大優勢,但當我們切換到佔用過百 GB 記憶體的大型模型時,兩者的硬體效能分野才真正浮現。在 Flash-Next 測試中效能差距更大,由 M3 Ultra 69.4 tok/s 升至 M5 Ultra 114 tok/s,效能提升達到 65.7%,TTFT 則由約 M3 Ultra 的 1.10 秒縮短至 M5 Ultra 的 0.43 秒。按相同輸出量換算,若生成 1,000 tokens,27B 約由 M3 Ultra 的 17.7 秒縮至 M5 Ultra 的 12.5 秒;Flash-Next 則約由 M3 Ultra 的 14.4 秒縮至 M5 Ultra 的 8.7 秒。這是按 generation tok/s 換算的時間,並非另一輪同步測試。換句話說,當你需要 AI 生成大段程式碼或長篇文章時,M5 Ultra 不單起步思考的時間縮短了一半以上,整體輸出的流暢度更帶來了肉眼可見的升級體驗,大幅減少了用家苦等的折磨。
除了持續生成速度,M5 Ultra 在 Prompt Prefill 亦有更大幅度提升。Qwen 3.8 27B 的 prefill throughput 由 M3 Ultra 約 378 tok/s 升至 M5 Ultra 約 1,095 tok/s,接近 2.9 倍;Flash-Next 則由約 561 tok/s 升至 1,208 tok/s,約 2.15 倍。Prefill 代表模型讀入 Prompt 與 Context 的速度,理論上對較長文件、RAG 或大型 Code Context 特別重要。不過今次 Debug 題只有約 500 多個 prompt tokens,因此這組數據只反映短上下文測試,不能直接當作長 Context benchmark。
測試 2(Qwen 3.8 Flash-Next):
▲ M3 Ultra 跑 Qwen 3.8 Flash-Next 錄得 69.4 tok/s。

▲ M5 Ultra 同一款 Qwen 3.8 Flash-Next 模型錄得 114 tok/s,比 M3 Ultra 提升約 65%。
LLM 大型語言模型測試總結
| 模型 | M3 Ultra | M5 Ultra | 提升 |
|---|---|---|---|
| Qwen 3.8 27B | 56.4 tok/s | 80.3 tok/s | +42.4% |
| Qwen 3.8 Flash-Next | 69.4 tok/s | 114 tok/s | +65.7% |
| 模型 | M3 Ultra TTFT | M5 Ultra TTFT | 縮短 |
|---|---|---|---|
| Qwen 3.8 27B | 1.50 秒 | 0.54 秒 | 約 64% |
| Qwen 3.8 Flash-Next | 1.10 秒 | 0.43 秒 | 約 61% |
▲ M5 Ultra 不只持續生成速度較高,開始生成首個 token 的等待時間亦明顯縮短。
| 模型 | M3 Ultra Prefill | M5 Ultra Prefill | 提升 |
|---|---|---|---|
| Qwen 3.8 27B | 378 tok/s | 1,095 tok/s | 約 2.9× |
| Qwen 3.8 Flash-Next | 561 tok/s | 1,208 tok/s | 約 2.15× |
▲ M5 Ultra 的 Prefill 提升比持續生成更明顯;但今次 Prompt 只有約 500 多 tokens,數據不等同長 Context 測試。
記憶體頻寬快五成 但不能只歸功於 RAM
為什麼速度會有如此顯著的提升?我們透過專門測試記憶體頻寬(資料傳輸速度)的軟件來尋找答案。我們在 StreamBench GPU Triad 實測,M3 Ultra 記憶體頻寬為 688.47GB/s,M5 Ultra 達 1,035.82GB/s,提升達 50.5%。持續 LLM 生成通常對記憶體頻寬敏感,因此這是解釋速度改善的重要原因。
不過,模型佔用 109GB 並不等於每生成一個 token 都會讀取全部 109GB;Flash-Next 又屬混合專家模型 MoE,所以不能直接以模型容量推論頻寬需求。其 66% 的速度增幅亦可能涉及 MoE 運算、MTP 驗證效率及其他軟硬件因素。M5 Ultra 官方記憶體頻寬為 1.2TB/s,比 M3 Ultra 高 50%,而每個 GPU Core 亦新增 Neural Accelerator,並採用新 Shader Core、第二代 Dynamic Caching 及新版 UltraFusion。這意味著不單止是「資料通道變闊了」,連底層的處理引擎架構也全面升級了。
| Memory Bandwidth | M3 Ultra | M5 Ultra | 差距 |
|---|---|---|---|
| Apple 官方規格 | 819GB/s | 1.2TB/s | 約 +46.5% |
| StreamBench GPU Triad | 688.47GB/s | 1,035.82GB/s | +50.5% |
▲ StreamBench 實測頻寬提升約五成,與 Apple 官方規格的代際升幅方向一致。


▲ M3 Ultra StreamBench GPU 測試,Triad 實測為 688.47GB/s。


▲ M5 Ultra 同一測試的 Triad 達 1,035.82GB/s,實測提升約 50.5%。
功耗只小幅增加 傳統 Benchmark 亦全面提升
性能大幅躍升,會不會導致極度耗電?在 LLM 測試時我們同時運行 Powermetrics 測試,當中 27B 的 GPU 平均功耗估算由 M3 Ultra 約 63.9W 升至 M5 Ultra 67.7W;Flash-Next 則由 M5 Ultra 的 45.2W 升至 M5 Ultra 的 48.0W,兩者約增加 6%。相對 generation throughput 分別增加了 42% 以及 66%,顯示 GPU 推理效率有改善跡象。不過功耗與速度來自不同輪次,而且 powermetrics 是軟件估算而非通過電源插座偵測耗電量,因此我們只作趨勢參考。
| Workload | M3 Ultra GPU | M5 Ultra GPU | 功耗變化 | 生成速度提升 |
|---|---|---|---|---|
| Qwen 3.8 27B | 約 63.9W | 約 67.7W | 約 +5.9% | +42.4% |
| Qwen 3.8 Flash-Next | 約 45.2W | 約 48.0W | 約 +6.0% | +65.7% |
註:GPU Power 為 macOS powermetrics 軟件估算,而且來自分開輪次測試,並非插座量得的整機耗電。
▲ 今次測試中 GPU 功耗估算只增加約 6%,但 generation throughput 提升約 42% 至 66%。


▲運行 Qwen 3.8 Flash-Next 時 M5 Ultra 的 GPU 平均功耗為 48.0W,只比 M3 Ultra 略為增加,但生成速度可提升 42% 以及 66%
除了專攻 AI 領域,M5 Ultra 在傳統的電腦效能指標上,也看得出並非是小幅度升級。在 Geekbench 7 效能測試當中,單核跑分相比 M3 Ultra 提升達 30.3%,而多核跑分測試有 37.6% 提升,而 GPU Metal 跑分更有 40.8% 提升。然後我們在 Cinebench 2026 進行跑分,多核及 GPU 分別提升 59% 及 72.2%。

SSD 速度方面,我們今次兩部測試機同為 4TB SSD,在 Blackmagic Disk Speed Test 寫入由 M3 Ultra 的 7.05GB/s 提升至 M5 Ultra 的 11.35GB/s,速度提升 61%;讀取更由 M3 Ultra 的 5.76GB/s 升至 M5 Ultra 的 13.76GB/s,速度提升約 139%。
| 測試 | M3 Ultra | M5 Ultra | 提升 |
|---|---|---|---|
| Geekbench 7 CPU Single | 2,884 | 3,758 | +30.3% |
| Geekbench 7 CPU Multi | 38,140 | 52,464 | +37.6% |
| Geekbench 7 Metal | 252,258 | 355,158 | +40.8% |
| Cinebench 2026 CPU Multi | 11,179 | 17,774 | +59.0% |
| Cinebench 2026 GPU | 81,831 | 140,943 | +72.2% |
| SSD Write | 7.05GB/s | 11.35GB/s | +61% |
| SSD Read | 5.76GB/s | 13.76GB/s | +139% |
▲ 除了 Local LLM,M5 Ultra 在 CPU、GPU 及 SSD 測試亦有明顯提升;SSD 讀取速度在今次 4TB 對 4TB 測試中達約 2.4 倍。


▲M5 Ultra Geekbench 7 效能測試
▲M3 Ultra Cinebench 2026 跑分
▲M5 Ultra Cinebench 2026 跑分。 Cinebench 2026 對比:M5 Ultra CPU Multi 及 GPU 分別比 M3 Ultra 高約 59% 及 72%。
▲M3 Ultra SSD 速度測試(Blackmagic Speed Test)
▲M5 Ultra SSD 速度測試(Blackmagic Speed Test)。兩部機同為 4TB SSD,M5 Ultra 在今次 Blackmagic 測試中寫入快約 61%,讀取快約 139%。
結論:M3 Ultra 未過時 但每日用 Local AI 就有升級理由
在總結兩代 Mac Studio 的表現之前,我們必須先釐清今次選用測試模型的意義。Qwen 3.8 Flash-Next 值得測試,不只是因為模型大,而是它已有相當強的公開能力評測。根據第三方機構的數據,它的 Artificial Analysis Intelligence Index 為 40 分,表現極之接近雲端頂級模型 Gemini 3.8 Flash High 的 41 分的成績;而在專注程式開發評測的 Qwen 官方 SWE-bench Pro Agentic Coding 亦錄得 62.5。

當然,我們要補充一點,這些分數只是交代模型能力背景,並非今次 MTPLX Dynamic 4-bit 版本的能力重測,也不代表 Flash-Next 與 Gemini 在所有任務表現相同。不過今次結果至少證明,一個公開能力評測已相當高、實際佔用約 109GB 記憶體的大型 Local LLM,可以在 M5 Ultra 單機達到 114 tok/s 的驚人流暢度,這代表著以往只能依賴雲端伺服器龐大算力的模型,現在已能真正在地化實用。
那麼回到最核心的問題:到底應否升級?對 M3 Ultra 用家而言,69.4 tok/s 本身已很實用,只是偶爾跑 Local AI 未必需要急於升級;但如果 Local LLM、Coding 已是你的每日主要工作負擔,在升級後我們獲得從 M3 Ultra 的 69.4 tok/s 提升至 M5 Ultra 的 114 tok/s 的效能提升,加上 TTFT 明顯下降,實際等待時間就有分別。不過客觀來說,今次沒有測完整工具呼叫、多檔案修改或 Coding Agent workflow,因此不能把 66% generation speed 直接理解成 Agent 任務亦快 66%,實際整體效率提升幅度仍會因應具體操作而有所不同。

最後,除了今次我們測試的 AI 跑分,我們不能忽略 M5 Ultra Mac Studio 的另一個價值,是它並非 AI 專用機器,仍可用作剪片、執相、Coding、娛樂及日常工作的主力電腦。擁有 256GB 級記憶體、能流暢運行高能力大型 Local LLM、生成速度達過百 tok/s,加上一機多用,才是今次 M5 Ultra 最有意思的定位。對於預算充足且需要極致工作效率的專業人士來說,絕對是一個極具吸引力的投資。

▲ 最終回到今次最具代表性的結果:M5 Ultra 單機跑 Qwen 3.8 Flash-Next 達 114 tok/s,而 Mac Studio 本身仍是一部完整的多用途工作站。

由於今次只有兩天作初步測試,主要集中在短 Context、單一 request 的 Local LLM 表現;更長 Context Prefill、持續多輪對話、Coding Agent workflow 及 concurrent inference 等實戰,將留待 unwire 後續再深入測試
