技術指南 · 2026-09-28

本地 AI 部署要買咩電腦?
2026 硬件指南What Computer Do You Need for Local AI in 2026?

由 7B 到 284B 模型,三個硬件路線點揀先啱你 workload?唔使逐個型號背 specs,跟住呢篇指南就識揀。From 7B to 284B parameter models — three hardware routes mapped to your workload. No spec-sheet memorising required.

HARDWARE SCAN 2026-09-28
MODELS: 7B–284B ROUTES: 3 MEMORY: 4GB–512GB
▸ 2026 年第四季建議清單 ✓ 已更新

一切由「你行咩模型」開始It All Starts With What Model You Run

買電腦跑本地 AI 之前,首先要搞清楚一個問題:你打算行咩規模嘅模型?因為模型嘅參數數量直接決定你需要幾多記憶體。

一個簡單嘅通則:模型要喺 Q4 量化下完整裝入記憶體,你需要大約 參數 × 0.7GB。咁樣 AI 先會行得順,唔會慢到用唔到。

最常見嘅模型尺寸同對應記憶體需求(Q4 量化,4-bit 運算):

模型大小最低記憶體建議記憶體適合用途
7B(Phi-4 / Qwen 2.5 7B)4 GB5 GB文書、分類、摘要、翻譯
14B(Qwen 2.5 14B)8 GB10 GB進階分析、複雜問答
32B(Qwen 2.5 32B / DeepSeek Coder)19 GB22 GB程式碼生成、合約比對
70B(Llama 3 / Qwen 2.5 72B)42 GB49 GB專業推理、長文件處理
284B(DeepSeek V3 / 其他 MoE)≈160 GB≈180 GB企業級複雜任務

* 以上以 Q4_K_M 量化估算。未量化模型需求約 x3–4。

路線一:Apple Silicon Mac(M4 Max / M3 Ultra)Route 1 — Apple Silicon Mac

統一記憶體 64–512GB,可以 run 70B–284B 模型。最適合專業人士。Unified memory 64–512 GB, capable of running 70B–284B models. Best for professionals.

推薦配置

Mac Studio M3 Ultra128–192 GB 統一記憶體,跑 70B 順暢。最推薦畀律師行、會計師行、中小企業。
MacBook Pro M4 Max64–128 GB 統一記憶體,流動方案,跑 32B–70B 都得。適合要帶出街嘅 consultant。
Mac Pro(如適用)256–512 GB,真正跑 284B 模型嘅工作站級別。

優點

預設已夠大 memory bandwidth(400–800 GB/s)
無風扇或好靜,放 office 唔嘈
Mac 本身已係日常用機,一機兩用
MLX / llama.cpp 支援完善
成本高 — 加 RAM 選項極貴
GPU 算力不及同價位 RTX 卡
Windows-only 工具用唔到
APPLICABLE

適合邊類用家?

已經用緊 Mac 嘅專業人士、需要流動方案嘅顧問、重視靜音嘅 office 環境。尤其係 70B 模型用家——Apple Silicon 喺呢個範圍嘅 price-performance 其實好過 RTX 方案。

路線二:NVIDIA RTX PC(RTX 4070–5090)Route 2 — NVIDIA RTX PC

12–32GB VRAM,7B–70B 模型速度快。適合追求 token 速度嘅玩家同開發者。12–32 GB VRAM, fast inference on 7B–70B models. Best for power users and developers.

推薦顯示卡配置

RTX 4070 / 4070 Ti Super12–16 GB VRAM,跑 7B–14B 極快,32B 要掂下量化。性價比最高入門方案。
RTX 4080 Super16 GB VRAM,14B 同 32B 都行得順。適合開發者嘅 sweet spot。
RTX 509032 GB VRAM,可以跑 70B(Q4 量化)。目前消費級最強選擇。
RTX 6000 Ada / A600048 GB VRAM 或以上,專業卡,雙卡行 70B+。企業方案。

重要提醒:VRAM 上限就係你的上限

同 Apple Silicon 唔同,NVIDIA 顯卡嘅 VRAM 係焊死嘅——你冇得之後再加。一開頭就要諗清楚你未來半年可能行嘅最大模型係咩。行 32B 最少要 24GB VRAM(RTX 4090 / 5090),行 70B 最少兩張 24GB 卡夾埋。

Token 速度最快(比 Apple Silicon 快 2–5x)
CUDA / TensorRT 生態最成熟
遊戲 + AI 一機搞掂
多卡擴充(但唔 cheap)
VRAM 封頂,冇得 upgrade
高階卡食電、發熱、要 water cooling
多卡方案機箱空間同火牛要求高
APPLICABLE

適合邊類用家?

開發者、AI 玩家、需要快速 iteration 嘅研究人員。 token 速度係你首要考慮嘅話,RTX 係唯一答案。但如果你要行 70B 以上,就要接受多卡嘅複雜度。

路線三:DGX Spark / GB10Route 3 — DGX Spark / GB10

統一記憶體 128GB,70B–284B 模型,企業級方案。Unified memory 128 GB, enterprise-grade, runs 70B–284B models out of the box.

NVIDIA 喺 2026 年推出嘅 DGX Spark(代號 GB10)係一個專為 AI 設計嘅 mini workstation。佢用 Grace CPU + Blackwell GPU 嘅統一記憶體架構,128GB 共享記憶體,可以直接 load 70B 模型,甚至可以掂下 284B 嘅 MoE 模型(配合適當量化)。

規格

統一記憶體128 GB,CPU 同 GPU 共享,唔使諗 VRAM 夠唔夠
支援模型70B(順行)、284B MoE(掂到)
生態NVIDIA AI Enterprise、CUDA、TensorRT-LLM 原生支援
尺寸Mac Mini 大小,放 desktop 好慳位
功耗約 150W,比高階 RTX PC 低好多
統一記憶體 = 唔使煩 VRAM 限制
企業級 CUDA 生態完整
細部、靜、低功耗
即插即用,setup 最簡單
推出初期供應緊張,難買
128GB 記憶體上限固定(冇得 upgrade)
唔係日常電腦 — 係 AI 專用機

點揀?一張圖睇晒Decision Matrix — At a Glance

Apple Silicon MacRTX PCDGX Spark
7B(Phi-4)✓ 順✓ 極快✓ 順
14B✓ 順✓ 極快✓ 順
32B✓ 順△ 要 24GB+✓ 順
70B✓ 順(128GB+)△ 多卡方案✓ 順
284B MoE△ 掂到(192GB+)✗ 極難△ 掂到
Token 速度中極快中快
擴充性買時決定多卡可行固定
日常用機✓ 係✓ 係✗ 專用機

升級路徑:由細玩起,將來再擴充Upgrade Path — Start Small, Scale Later

最多人犯嘅錯——一步到位買最貴嘅硬件,結果發現自己根本用唔盡。四個穩陣嘅升級路徑:

  1. STEP 01 先用 7B / 14B 模型試水
    即使你部電腦普通啲,都可以用 CPU 行 phi-4 或 Qwen 2.5 7B(Q4 量化)試下水溫。摸清楚你嘅 workflow 先。
  2. STEP 02 確認需求後先決定路線
    你係買 Mac 定砌 PC?如果本身用開 Mac 嘅,Mac Studio M3 Ultra 128GB 係最慳水慳力嘅方案。如果追求速度,RTX 4080 Super 或 5090 係方向。
  3. STEP 03 中型 scale 考慮 DGX Spark
    如果你需要行 70B 模型、但唔想煩多卡配置嘅話,DGX Spark 係最簡單嘅 turnkey 方案。
  4. STEP 04 真正大型 deployment 用多機
    當你需要行 284B+ 模型,或者同時服務多個 user 嘅時候,就要諗多機叢集。到時可以搵我哋傾 solution。
NEED HELP?

唔肯定邊條路線啱你?

我哋提供硬件諮詢服務,幫你按 workload 同 budget 揀最適合嘅方案。