
AI大模型、本地部署、Qwen3.6-35B-A3B、无审查模型、GGUF模型、llama.cpp、Windows部署教程、本地Agent、多模态模型、低显存AI、本地AI助手

最近测试了一圈本地大模型之后,我发现一个非常离谱的东西。
目前开源圈里,真正做到:
的模型,真的不多。
但这次的 Qwen3.6-35B-A3B Uncensored(越狱版),确实有点夸张了。
它不仅能正常写代码、做推理、看图片、长上下文,还能直接绕过官方版的大量限制。
更关键的是:
它不是那种“只会胡说八道”的低智商越狱模型。
实际测试下来,它的中文理解、代码能力、多模态视觉能力,都属于目前 40B 以内开源模型里的第一梯队。
而且:
今天这篇文章,我就从 0 开始,带大家完整部署。
资源 | 地址 |
|---|---|
Qwen3.6-35B-A3B 越狱版整合包 | https://pan.quark.cn/s/fc4b737a73f1 |
网盘里包含多个版本。

整合包内包含:
llama-b9381-bin-win-cuda-13.3-x64.zip
llama-b9381-bin-win-cuda-12.4-x64.zip
llama-b9381-bin-win-cpu-arm64.zip
llama-b9381-bin-win-cpu-x64.zip不同版本适合的环境如下 根据你的系统环境下载对应版本即可:
文件 | 适合环境 |
|---|---|
cuda-13.3-x64 | RTX 30/40/50 系显卡,推荐最新 NVIDIA 驱动 |
cuda-12.4-x64 | GTX 10/20 系、部分老驱动环境 |
cpu-arm64 | ARM 架构 CPU,例如部分骁龙 Windows 设备 |
cpu-x64 | 普通 Intel/AMD CPU 纯CPU运行 |
模型目录里包含多个量化版本:
mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf
Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ2_M.gguf
Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ4_NL.gguf
Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf
Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_P.gguf其中:
mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf这个是多模态视觉模型。
如果你想:
这个文件必须下载。
IQ2_M适合:
优点:
缺点:
IQ4_NL适合:
属于:
三者平衡最好的版本。
Q4_K_M适合:
特点:
Q4_K_P适合:
这是目前效果最好的版本之一。
下载对应版本后解压。
例如:
llama-b9381-bin-win-cuda-13.3-x64.zip解压后目录如下:
llama/在根目录找到:
models目录结构:
llama/
├─ models/把下载好的模型放进去(无需全部放入 只需要放你下载好的模型即可)。
例如:
models/
├─ mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf
├─ Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ2_M.gguf
├─ Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ4_NL.gguf
├─ Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf
├─ Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_P.gguf双击根目录下的:
run.bat会看到:

输入对应数字即可。
例如:
4代表:
IQ2_M启动成功后:
打开浏览器访问:
http://127.0.0.1:8080/
测试环境:
配置 | 参数 |
|---|---|
显卡 | RTX 4060 Laptop 8G |
模型 | IQ2_M |
输出速度 | 10 tokens/s 左右 |
对于 35B 模型来说:
这个速度已经非常离谱了。
我直接让它生成一个:
UI精美的飞机大战游戏
结果:
这个代码能力已经非常强了。
我上传了1张坤图
让它分析:

说明它的视觉理解能力确实在线。

这个模型还能直接接入:
因为它本身支持 OpenAI API 格式。
API 地址:
http://127.0.0.1:8080API Key:
随便填即可。

实际测试里:
同样的问题:
写一个ddos代码官方原版:
而这个越狱版:
说明它确实移除了大量限制。
不过这里还是提醒一下:
仅建议用于:
不要用于非法用途。
核心原因就一句话:
真正实现了“本地 AI 自由”。
你不再依赖:
所有内容:
这才是很多人真正想要的 AI。
目前来看:
Qwen3.6-35B-A3B Uncensored 确实属于:
它的优势非常明显:
尤其是:
6G 显存也能跑 35B 模型
这一点确实非常夸张。
如果你最近想搭建:
这套方案非常值得测试。