技術指南 · 2026-09-28
由 7B 到 284B 模型,三個硬件路線點揀先啱你 workload?唔使逐個型號背 specs,跟住呢篇指南就識揀。From 7B to 284B parameter models — three hardware routes mapped to your workload. No spec-sheet memorising required.
買電腦跑本地 AI 之前,首先要搞清楚一個問題:你打算行咩規模嘅模型?因為模型嘅參數數量直接決定你需要幾多記憶體。
一個簡單嘅通則:模型要喺 Q4 量化下完整裝入記憶體,你需要大約 參數 × 0.7GB。咁樣 AI 先會行得順,唔會慢到用唔到。
最常見嘅模型尺寸同對應記憶體需求(Q4 量化,4-bit 運算):
| 模型大小 | 最低記憶體 | 建議記憶體 | 適合用途 |
|---|---|---|---|
| 7B(Phi-4 / Qwen 2.5 7B) | 4 GB | 5 GB | 文書、分類、摘要、翻譯 |
| 14B(Qwen 2.5 14B) | 8 GB | 10 GB | 進階分析、複雜問答 |
| 32B(Qwen 2.5 32B / DeepSeek Coder) | 19 GB | 22 GB | 程式碼生成、合約比對 |
| 70B(Llama 3 / Qwen 2.5 72B) | 42 GB | 49 GB | 專業推理、長文件處理 |
| 284B(DeepSeek V3 / 其他 MoE) | ≈160 GB | ≈180 GB | 企業級複雜任務 |
* 以上以 Q4_K_M 量化估算。未量化模型需求約 x3–4。
統一記憶體 64–512GB,可以 run 70B–284B 模型。最適合專業人士。Unified memory 64–512 GB, capable of running 70B–284B models. Best for professionals.
| Mac Studio M3 Ultra | 128–192 GB 統一記憶體,跑 70B 順暢。最推薦畀律師行、會計師行、中小企業。 |
|---|---|
| MacBook Pro M4 Max | 64–128 GB 統一記憶體,流動方案,跑 32B–70B 都得。適合要帶出街嘅 consultant。 |
| Mac Pro(如適用) | 256–512 GB,真正跑 284B 模型嘅工作站級別。 |
已經用緊 Mac 嘅專業人士、需要流動方案嘅顧問、重視靜音嘅 office 環境。尤其係 70B 模型用家——Apple Silicon 喺呢個範圍嘅 price-performance 其實好過 RTX 方案。
12–32GB VRAM,7B–70B 模型速度快。適合追求 token 速度嘅玩家同開發者。12–32 GB VRAM, fast inference on 7B–70B models. Best for power users and developers.
| RTX 4070 / 4070 Ti Super | 12–16 GB VRAM,跑 7B–14B 極快,32B 要掂下量化。性價比最高入門方案。 |
|---|---|
| RTX 4080 Super | 16 GB VRAM,14B 同 32B 都行得順。適合開發者嘅 sweet spot。 |
| RTX 5090 | 32 GB VRAM,可以跑 70B(Q4 量化)。目前消費級最強選擇。 |
| RTX 6000 Ada / A6000 | 48 GB VRAM 或以上,專業卡,雙卡行 70B+。企業方案。 |
同 Apple Silicon 唔同,NVIDIA 顯卡嘅 VRAM 係焊死嘅——你冇得之後再加。一開頭就要諗清楚你未來半年可能行嘅最大模型係咩。行 32B 最少要 24GB VRAM(RTX 4090 / 5090),行 70B 最少兩張 24GB 卡夾埋。
開發者、AI 玩家、需要快速 iteration 嘅研究人員。 token 速度係你首要考慮嘅話,RTX 係唯一答案。但如果你要行 70B 以上,就要接受多卡嘅複雜度。
統一記憶體 128GB,70B–284B 模型,企業級方案。Unified memory 128 GB, enterprise-grade, runs 70B–284B models out of the box.
NVIDIA 喺 2026 年推出嘅 DGX Spark(代號 GB10)係一個專為 AI 設計嘅 mini workstation。佢用 Grace CPU + Blackwell GPU 嘅統一記憶體架構,128GB 共享記憶體,可以直接 load 70B 模型,甚至可以掂下 284B 嘅 MoE 模型(配合適當量化)。
| 統一記憶體 | 128 GB,CPU 同 GPU 共享,唔使諗 VRAM 夠唔夠 |
|---|---|
| 支援模型 | 70B(順行)、284B MoE(掂到) |
| 生態 | NVIDIA AI Enterprise、CUDA、TensorRT-LLM 原生支援 |
| 尺寸 | Mac Mini 大小,放 desktop 好慳位 |
| 功耗 | 約 150W,比高階 RTX PC 低好多 |
| Apple Silicon Mac | RTX PC | DGX Spark | |
|---|---|---|---|
| 7B(Phi-4) | ✓ 順 | ✓ 極快 | ✓ 順 |
| 14B | ✓ 順 | ✓ 極快 | ✓ 順 |
| 32B | ✓ 順 | △ 要 24GB+ | ✓ 順 |
| 70B | ✓ 順(128GB+) | △ 多卡方案 | ✓ 順 |
| 284B MoE | △ 掂到(192GB+) | ✗ 極難 | △ 掂到 |
| Token 速度 | 中 | 極快 | 中快 |
| 擴充性 | 買時決定 | 多卡可行 | 固定 |
| 日常用機 | ✓ 係 | ✓ 係 | ✗ 專用機 |
最多人犯嘅錯——一步到位買最貴嘅硬件,結果發現自己根本用唔盡。四個穩陣嘅升級路徑:
我哋提供硬件諮詢服務,幫你按 workload 同 budget 揀最適合嘅方案。
香港本地 AI 部署服務 · 律師行、診所、保險經紀、會計師行