Qwen3.6-35B-A3B 無審查版地端部署可以在 6 GB 顯示記憶體的電腦啟動,但前提是把部分模型層卸載到系統記憶體,使用約 11 GB 的 IQ2_M 量化檔,並把 context 先壓在 8K。 這不等於 6 GB 顯示記憶體能完整裝下 35B 模型。若只有 6 GB 顯示記憶體,又沒有至少 24 GB 系統記憶體,這條路多半不實用。
這篇教學處理的是 HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive 社群衍生版。它不是 Qwen Team 官方釋出的無審查模型。官方基礎模型是 Qwen/Qwen3.6-35B-A3B,兩者的來源與責任邊界必須分開看。
先說結論:6 GB 能跑,但不是「全塞進顯示記憶體」
Qwen3.6-35B-A3B 在 2026 年 4 月 15 日公開。官方資料列出 35B 總參數、約 3B 啟用參數、256 個 experts,以及 262,144 tokens 原生 context。授權採 Apache 2.0。
A3B 描述的是每次推論啟用的參數量,不是模型檔案只有 3B。未被選中的 experts 仍要存在記憶體或儲存裝置,推論時也可能被路由使用。社群版頁面列出的量化檔大小如下:
| 量化 | 約略檔案大小 | 適合情境 |
|---|---|---|
| IQ2_M | 11 GB | 6 GB 顯示記憶體最低可行設定;品質犧牲最大 |
| IQ3_M | 15 GB | 8–12 GB 顯示記憶體搭配 32 GB 系統記憶體 |
| IQ4_XS | 19 GB | 16 GB 以上顯示記憶體,或較多系統記憶體 |
| Q4_K_M | 21 GB | 24 GB 顯示記憶體的實用起點,仍要預留 KV cache |
| Q6_K_P | 31 GB | 偏重品質,硬體門檻明顯提高 |
表格中的檔案大小來自社群模型卡,並非我們的效能實測。實際記憶體還要加上 KV cache、執行環境與作業系統。Context 越長,額外占用越高。6 GB 設定不應照模型卡建議直接開 128K。
「最強」與「0 拒答」都不是可直接採信的結論
官方公布的基礎模型成績包括 SWE-bench Verified 73.4、Terminal-Bench 2.0 51.5、Claw-Eval 平均 68.7、MCPMark 37.0、MMLU-Pro 85.2,以及 GPQA 86.0。這些數字來自 Qwen Team 的測試條件,適合用來理解模型定位,不能等同於每台本機都會得到相同結果。
社群作者宣稱無審查版達到「0/465 refusals」,也表示沒有改變原始能力。模型頁沒有提供足以獨立重現的完整評測方法。比較準確的說法是:這是一個降低拒答傾向的社群 GGUF 衍生版。它是不是「最強」,仍取決於量化、提示、任務與硬體。
截至 2026 年 7 月 22 日,Hugging Face API 顯示該社群頁面約有 200 萬次下載與 2,974 個 likes。熱度可以說明需求,不能代替安全或品質驗證。
最低硬體設定
以下配置適合先確認能否啟動,不代表舒服的日常速度:
| 元件 | 最低建議 | 比較穩妥 |
|---|---|---|
| NVIDIA 顯示記憶體 | 6 GB | 12 GB 以上 |
| 系統記憶體 | 24 GB | 32 GB 以上 |
| 磁碟空間 | 20 GB 可用 | 40 GB 可用 |
| 量化 | IQ2_M | IQ3_M 或更高 |
| Context | 4K–8K | 8K–32K,視記憶體調整 |
| 模式 | 純文字 | 視硬體再加 vision projector |
最低方案先不要下載約 899 MB 的 mmproj。它是視覺輸入所需的 projector,會再吃記憶體。先把純文字推論跑穩,再決定是否加入圖片功能。
步驟一:在 Ubuntu 或 WSL2 編譯 llama.cpp
以下指令以 NVIDIA GPU、CUDA、Ubuntu 或 Windows WSL2 為例。先確認驅動可見:
nvidia-smi
安裝編譯工具並建立 CUDA 版 llama.cpp:
sudo apt update
sudo apt install -y git cmake build-essential python3-pip
git clone https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
cmake -B build -DGGML_CUDA=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --config Release -j
官方 llama-server 支援 -ngl 控制放進顯示記憶體的層數,也支援 -c 設定 context。這正是 6 GB 顯示記憶體能使用大型 GGUF 的關鍵。
步驟二:固定版本下載 IQ2_M
先安裝 Hugging Face 官方 CLI:
python3 -m pip install -U huggingface_hub
下載時固定社群儲存庫的 commit,避免日後同名檔案被替換:
mkdir -p models/qwen36-uncensored
hf download \
HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive \
Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ2_M.gguf \
--revision f12a584fecbeb5f20001130d8ecd66c9327ae685 \
--local-dir models/qwen36-uncensored
計算雜湊並留存。日後換機或重抓時,應比較兩次結果:
sha256sum models/qwen36-uncensored/*IQ2_M.gguf
這一步很重要。無審查版由社群帳號發布,不是 Qwen Team 的官方 artifact。企業環境應把下載來源、commit 與 SHA-256 一起寫進軟體物料清單。
步驟三:先用 8K context 與少量 GPU layers 啟動
./build/bin/llama-server \
-m models/qwen36-uncensored/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ2_M.gguf \
--jinja \
-c 8192 \
-ngl 12 \
--host 127.0.0.1 \
--port 8080
-ngl 12 是保守起點,不是所有 6 GB GPU 的固定答案。若啟動時出現 CUDA out of memory,先降到 -ngl 8 或 -ngl 4。若顯示記憶體仍有餘裕,再逐步加到 16、20,觀察載入是否穩定。
請保留 --host 127.0.0.1。降低拒答的模型不該直接暴露在公網。若真的需要區域網路存取,前面至少要有驗證、速率限制、TLS 與稽核紀錄。
步驟四:用 OpenAI 相容 API 測試
另開一個 terminal:
curl http://127.0.0.1:8080/v1/chat/completions \
-H 'Content-Type: application/json' \
-d '{
"model": "local-qwen",
"messages": [
{
"role": "user",
"content": "Explain mixture-of-experts in 120 words."
}
],
"temperature": 0.7
}'
能收到 JSON 回應,代表基本服務已經通了。接著用 nvidia-smi 觀察顯示記憶體,再看系統 swap 是否持續成長。大量 swap 通常代表系統記憶體不足,速度也會明顯下降。
步驟五:依錯誤調整,不要一次把 context 拉滿
常見問題可用這張表處理:
| 症狀 | 原因 | 調整方式 |
|---|---|---|
| 啟動時 CUDA OOM | GPU layers 太多 | 降低 -ngl |
| 載入後系統卡死 | 系統記憶體不足 | 關閉其他程式、降 context,或增加 RAM |
| 首字等待很久 | 權重多數在 CPU/RAM | 增加 -ngl,或換更大顯示記憶體 |
| 長對話突然 OOM | KV cache 變大 | 把 -c 8192 降為 4096 |
| 回答品質不穩 | IQ2_M 壓縮過重 | 改 IQ3_M、Q4_K_M,或使用官方權重 |
| 圖片無法輸入 | 未載入 mmproj | 最低配置先接受純文字模式 |
35B MoE 的 3B active 會降低每個 token 的運算量,無法消除完整權重的儲存需求。把這兩件事分開,才不會被「3B 啟用」誤導成「3B 模型」。
無審查模型的安全底線
降低拒答不會提高事實正確率,也不會自動改善程式碼安全。部署前至少做六件事:
- 使用獨立使用者或容器執行,不掛載 SSH key、雲端憑證與客戶資料。
- 預設關閉外網與 shell 工具,確定需求後再逐項開放。
- 把 API 綁在 localhost,避免匿名存取。
- 固定模型 commit,保存檔案雜湊與下載日期。
- 對輸出做內容與法律審查,尤其是醫療、金融、資安與個資情境。
- 準備可關閉服務、撤銷權限與清除紀錄的停損流程。
對研發人員來說,這個版本的價值是測試拒答邊界與在地推論。對公司而言,它也會移除原本由模型供應商承擔的一部分保護。最後的安全責任會落到部署者身上。
常見問題
6 GB 顯示記憶體真的可以跑 Qwen3.6-35B-A3B 嗎?
可以啟動 IQ2_M 文字版,但必須把部分 layers 放到系統記憶體。建議至少 24 GB RAM,32 GB 較穩。這不是 6 GB 顯示記憶體完整載入。
A3B 是否代表模型只需要 3B 的記憶體?
不是。A3B 代表每次推論約啟用 3B 參數。35B 總權重仍要放在顯示記憶體、系統記憶體或兩者之中。
無審查版是 Qwen 官方模型嗎?
不是。Qwen Team 提供基礎模型;本文使用的 Aggressive 版本由 HauhauCS 社群帳號發布。
6 GB 設定能使用 128K 或 262K context 嗎?
不建議。長 context 會擴大 KV cache。最低配置先從 4K 或 8K 開始,再依記憶體逐步增加。
應該選 IQ2_M 還是 Q4_K_M?
6 GB 顯示記憶體以 IQ2_M 測試啟動。若有 24 GB 顯示記憶體與足夠 RAM,Q4_K_M 通常更值得,因為量化損失較少。
Author Insight
「6 GB 就能跑」有吸引力,卻把最重要的成本藏在系統記憶體、等待時間與量化損失裡。MoE 讓大型模型的運算變輕,沒有讓完整模型憑空縮成 3B。真正值得優化的,是任務需要的 context、可接受的品質,以及資料能不能離開本機。
若你的團隊正在評估地端 AI,先用一個受隔離的測試環境完成品質、安全與成本驗證,再決定要不要接進正式流程。Tenten 能協助企業整理地端模型的應用邊界、權限設計與可驗證的導入路線。
權威引用
- Qwen Team,Qwen3.6-35B-A3B 官方發布:https://qwen.ai/blog?id=qwen3.6-35b-a3b
- Qwen 官方模型卡:https://huggingface.co/Qwen/Qwen3.6-35B-A3B
- Qwen3.6 官方 GitHub:https://github.com/QwenLM/Qwen3.6
- HauhauCS 社群 GGUF 模型卡:https://huggingface.co/HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- llama.cpp server 文件:https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
- Hugging Face CLI 文件:https://huggingface.co/docs/huggingface_hub/guides/cli
