Qwen3.6-35B-A3B 無審查版地端部署可以在 6 GB 顯示記憶體的電腦啟動,但前提是把部分模型層卸載到系統記憶體,使用約 11 GB 的 IQ2_M 量化檔,並把 context 先壓在 8K。 這不等於 6 GB 顯示記憶體能完整裝下 35B 模型。若只有 6 GB 顯示記憶體,又沒有至少 24 GB 系統記憶體,這條路多半不實用。

這篇教學處理的是 HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive 社群衍生版。它不是 Qwen Team 官方釋出的無審查模型。官方基礎模型是 Qwen/Qwen3.6-35B-A3B,兩者的來源與責任邊界必須分開看。

先說結論:6 GB 能跑,但不是「全塞進顯示記憶體」

Qwen3.6-35B-A3B 在 2026 年 4 月 15 日公開。官方資料列出 35B 總參數、約 3B 啟用參數、256 個 experts,以及 262,144 tokens 原生 context。授權採 Apache 2.0。

A3B 描述的是每次推論啟用的參數量,不是模型檔案只有 3B。未被選中的 experts 仍要存在記憶體或儲存裝置,推論時也可能被路由使用。社群版頁面列出的量化檔大小如下:

量化 約略檔案大小 適合情境
IQ2_M 11 GB 6 GB 顯示記憶體最低可行設定;品質犧牲最大
IQ3_M 15 GB 8–12 GB 顯示記憶體搭配 32 GB 系統記憶體
IQ4_XS 19 GB 16 GB 以上顯示記憶體,或較多系統記憶體
Q4_K_M 21 GB 24 GB 顯示記憶體的實用起點,仍要預留 KV cache
Q6_K_P 31 GB 偏重品質,硬體門檻明顯提高

表格中的檔案大小來自社群模型卡,並非我們的效能實測。實際記憶體還要加上 KV cache、執行環境與作業系統。Context 越長,額外占用越高。6 GB 設定不應照模型卡建議直接開 128K。

「最強」與「0 拒答」都不是可直接採信的結論

官方公布的基礎模型成績包括 SWE-bench Verified 73.4、Terminal-Bench 2.0 51.5、Claw-Eval 平均 68.7、MCPMark 37.0、MMLU-Pro 85.2,以及 GPQA 86.0。這些數字來自 Qwen Team 的測試條件,適合用來理解模型定位,不能等同於每台本機都會得到相同結果。

社群作者宣稱無審查版達到「0/465 refusals」,也表示沒有改變原始能力。模型頁沒有提供足以獨立重現的完整評測方法。比較準確的說法是:這是一個降低拒答傾向的社群 GGUF 衍生版。它是不是「最強」,仍取決於量化、提示、任務與硬體。

截至 2026 年 7 月 22 日,Hugging Face API 顯示該社群頁面約有 200 萬次下載與 2,974 個 likes。熱度可以說明需求,不能代替安全或品質驗證。

最低硬體設定

以下配置適合先確認能否啟動,不代表舒服的日常速度:

元件 最低建議 比較穩妥
NVIDIA 顯示記憶體 6 GB 12 GB 以上
系統記憶體 24 GB 32 GB 以上
磁碟空間 20 GB 可用 40 GB 可用
量化 IQ2_M IQ3_M 或更高
Context 4K–8K 8K–32K,視記憶體調整
模式 純文字 視硬體再加 vision projector

最低方案先不要下載約 899 MB 的 mmproj。它是視覺輸入所需的 projector,會再吃記憶體。先把純文字推論跑穩,再決定是否加入圖片功能。

步驟一:在 Ubuntu 或 WSL2 編譯 llama.cpp

以下指令以 NVIDIA GPU、CUDA、Ubuntu 或 Windows WSL2 為例。先確認驅動可見:

nvidia-smi

安裝編譯工具並建立 CUDA 版 llama.cpp:

sudo apt update
sudo apt install -y git cmake build-essential python3-pip

git clone https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
cmake -B build -DGGML_CUDA=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --config Release -j

官方 llama-server 支援 -ngl 控制放進顯示記憶體的層數,也支援 -c 設定 context。這正是 6 GB 顯示記憶體能使用大型 GGUF 的關鍵。

步驟二:固定版本下載 IQ2_M

先安裝 Hugging Face 官方 CLI:

python3 -m pip install -U huggingface_hub

下載時固定社群儲存庫的 commit,避免日後同名檔案被替換:

mkdir -p models/qwen36-uncensored

hf download \
  HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive \
  Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ2_M.gguf \
  --revision f12a584fecbeb5f20001130d8ecd66c9327ae685 \
  --local-dir models/qwen36-uncensored

計算雜湊並留存。日後換機或重抓時,應比較兩次結果:

sha256sum models/qwen36-uncensored/*IQ2_M.gguf

這一步很重要。無審查版由社群帳號發布,不是 Qwen Team 的官方 artifact。企業環境應把下載來源、commit 與 SHA-256 一起寫進軟體物料清單。

步驟三:先用 8K context 與少量 GPU layers 啟動

./build/bin/llama-server \
  -m models/qwen36-uncensored/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ2_M.gguf \
  --jinja \
  -c 8192 \
  -ngl 12 \
  --host 127.0.0.1 \
  --port 8080

-ngl 12 是保守起點,不是所有 6 GB GPU 的固定答案。若啟動時出現 CUDA out of memory,先降到 -ngl 8-ngl 4。若顯示記憶體仍有餘裕,再逐步加到 16、20,觀察載入是否穩定。

請保留 --host 127.0.0.1。降低拒答的模型不該直接暴露在公網。若真的需要區域網路存取,前面至少要有驗證、速率限制、TLS 與稽核紀錄。

步驟四:用 OpenAI 相容 API 測試

另開一個 terminal:

curl http://127.0.0.1:8080/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "local-qwen",
    "messages": [
      {
        "role": "user",
        "content": "Explain mixture-of-experts in 120 words."
      }
    ],
    "temperature": 0.7
  }'

能收到 JSON 回應,代表基本服務已經通了。接著用 nvidia-smi 觀察顯示記憶體,再看系統 swap 是否持續成長。大量 swap 通常代表系統記憶體不足,速度也會明顯下降。

步驟五:依錯誤調整,不要一次把 context 拉滿

常見問題可用這張表處理:

症狀 原因 調整方式
啟動時 CUDA OOM GPU layers 太多 降低 -ngl
載入後系統卡死 系統記憶體不足 關閉其他程式、降 context,或增加 RAM
首字等待很久 權重多數在 CPU/RAM 增加 -ngl,或換更大顯示記憶體
長對話突然 OOM KV cache 變大 -c 8192 降為 4096
回答品質不穩 IQ2_M 壓縮過重 改 IQ3_M、Q4_K_M,或使用官方權重
圖片無法輸入 未載入 mmproj 最低配置先接受純文字模式

35B MoE 的 3B active 會降低每個 token 的運算量,無法消除完整權重的儲存需求。把這兩件事分開,才不會被「3B 啟用」誤導成「3B 模型」。

無審查模型的安全底線

降低拒答不會提高事實正確率,也不會自動改善程式碼安全。部署前至少做六件事:

  1. 使用獨立使用者或容器執行,不掛載 SSH key、雲端憑證與客戶資料。
  2. 預設關閉外網與 shell 工具,確定需求後再逐項開放。
  3. 把 API 綁在 localhost,避免匿名存取。
  4. 固定模型 commit,保存檔案雜湊與下載日期。
  5. 對輸出做內容與法律審查,尤其是醫療、金融、資安與個資情境。
  6. 準備可關閉服務、撤銷權限與清除紀錄的停損流程。

對研發人員來說,這個版本的價值是測試拒答邊界與在地推論。對公司而言,它也會移除原本由模型供應商承擔的一部分保護。最後的安全責任會落到部署者身上。

常見問題

6 GB 顯示記憶體真的可以跑 Qwen3.6-35B-A3B 嗎?

可以啟動 IQ2_M 文字版,但必須把部分 layers 放到系統記憶體。建議至少 24 GB RAM,32 GB 較穩。這不是 6 GB 顯示記憶體完整載入。

A3B 是否代表模型只需要 3B 的記憶體?

不是。A3B 代表每次推論約啟用 3B 參數。35B 總權重仍要放在顯示記憶體、系統記憶體或兩者之中。

無審查版是 Qwen 官方模型嗎?

不是。Qwen Team 提供基礎模型;本文使用的 Aggressive 版本由 HauhauCS 社群帳號發布。

6 GB 設定能使用 128K 或 262K context 嗎?

不建議。長 context 會擴大 KV cache。最低配置先從 4K 或 8K 開始,再依記憶體逐步增加。

應該選 IQ2_M 還是 Q4_K_M?

6 GB 顯示記憶體以 IQ2_M 測試啟動。若有 24 GB 顯示記憶體與足夠 RAM,Q4_K_M 通常更值得,因為量化損失較少。

Author Insight

「6 GB 就能跑」有吸引力,卻把最重要的成本藏在系統記憶體、等待時間與量化損失裡。MoE 讓大型模型的運算變輕,沒有讓完整模型憑空縮成 3B。真正值得優化的,是任務需要的 context、可接受的品質,以及資料能不能離開本機。

若你的團隊正在評估地端 AI,先用一個受隔離的測試環境完成品質、安全與成本驗證,再決定要不要接進正式流程。Tenten 能協助企業整理地端模型的應用邊界、權限設計與可驗證的導入路線。

權威引用

  • Qwen Team,Qwen3.6-35B-A3B 官方發布:https://qwen.ai/blog?id=qwen3.6-35b-a3b
  • Qwen 官方模型卡:https://huggingface.co/Qwen/Qwen3.6-35B-A3B
  • Qwen3.6 官方 GitHub:https://github.com/QwenLM/Qwen3.6
  • HauhauCS 社群 GGUF 模型卡:https://huggingface.co/HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
  • llama.cpp server 文件:https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
  • Hugging Face CLI 文件:https://huggingface.co/docs/huggingface_hub/guides/cli
Share this post
Ewan Mak

I'm a Full Stack Developer with expertise in building modern web applications that fast, secure, and scalable. Crafting seamless user experiences with a passion for headless CMS, Vercel and Cloudflare

Loading...