08/09/2026
📱 數碼小知識:本地部署 AI,到底係點樣做?
仲以為「本地部署 AI」好高深?其實分返開就係「喺你部機度裝返個 AI,唔使上網、錢唔使逐句計」。以下係由零開始最正路嘅流程:
1️⃣ 先決條件:你部機有冇「齒輪」?
跑「本地 AI」同普通寫文件唔同——佢食記憶體(RAM / VRAM)食得好犀利。一般文書機得 16–32GB 系統記憶體 + 幾 GB 顯示卡記憶體,只夠行「細細粒」嘅模型(7B~14B 級)。想行 70B、100B+ 嗰啲靚模型,你先需要 96GB 或以上可畀 GPU 用嘅記憶體——呢啲先係我哋今次講緊嘅 Ryzen AI Max+ 395(128GB)嗰類機嘅位置。
2️⃣ 揀啱軟體:唔使寫程式,裝個「AI 播放器」就得
比喻嚟講,模型=「音樂檔案」,但你要個「播放器」先播到。最常用有幾個:
- LM Studio(最易上手,睇得見晒界面)
- Ollama(最簡單,一個指令就下載同跑)
- llama.cpp(高效能、彈性大,進階用家夾硬體用)
3️⃣ 下載模型:揀「量化版」先係精明位
模型檔案巨大(120B 模型原版成百幾 GB),所以大家都用「量化版」——即係壓縮咗嘅版本(例如 Q4),質素差不多但細好多倍。用 Ollama 一句 ollama run gpt-oss:120b 就搞掂下載同執行,唔使自己處理咩嘢。
4️⃣ 落地做嘢:連接你自己啲工具
跑起咗之後,可以用返 ChatGPT 嗰種對話界面(LM Studio 內置),或者將個模型開成「本地 API」,比你寫嘅 code、文件問答工具、VS Code 嘅 AI 插件接入。咁樣你就有一個唔使上網、資料唔離開部機嘅私人 AI。
5️⃣ 最重要一句
本地部署唔係「淨係 AI 專家先做到」——揀啱部有大統一記憶體嘅機,裝個 LM Studio / Ollama,下載一個量化模型,你基本上已經行緊本地 AI。難關唔係軟件,而係揀啱部「記憶體夠大」嘅機先。