4bit量化版

Searching…

blog.csdn.net

Qwen3.5-9B-AWQ-4bit效果对比实测:AWQ-4bit量化版 vs 原始FP16视觉理...

Apr 8, 2026 · 文章浏览阅读8次。本文介绍了如何在星图GPU平台上自动化部署Qwen3.5-9B-AWQ-4bit镜像,实现高效的视觉理解任务处理。该量化版模型在保持90-95%原始精度的同时,显著降低显存占用,特别适用于图片内容描述、OCR文字识别等批处理场景,为资源受限环境提供优化解决方案。

zhuanlan.zhihu.com

DeepSeek R1 满血版和 4-bit 32B 量化版的简单对比

Feb 15, 2025 · 如果把“满血版”和“4-bit 32B版”看作两个人,那么我的简单对比就好像是对这两个人的能力水平做了次面试。 我相信,既然对于两个人来说,几道题目的面试就足以发现他们的能力差别,那么对于两个大模型也应该能够做到。

developer.aliyun.com

大模型4-bit量化原理与GPTQ及AWQ算法实现-开发者社区-阿里云

Oct 14, 2025 · 本文系统阐述大语言模型的4-bit量化技术,深入解析GPTQ、AWQ等主流量化方法的原理与实现。通过详细的数学推导、代码实现和实验对比,展示4-bit量化如何将模型内存占用降低75%以上同时保持模型性能。文章涵盖量化感知训练、后训练量化、混合精度量化等关键技术,为开发者提供完整的模型压缩 ...

cloud.tencent.com

Video — click to view

Feb 3, 2026 · GLM-4.7-Flash开源模型本地部署教程,详细讲解AWQ-4bit量化版下载、vLLM升级及Docker部署方法。解决显存占用高、模型启动报错等常见问题,分享2张4090显卡运行经验。包含实用参数调整建议,帮助开发者高效部署30B级别最强轻量模型。

blog.csdn.net

Qwen3-VL-30B 4bit量化版发布:单卡部署,精度保留95%-CSDN博客

Dec 15, 2025 · Qwen3-VL-30B 4bit量化版发布:单卡部署,精度保留95% 在智能体系统日益追求“认知闭环”的今天,一个真正强大的AI不能再只是“识别图像”,而必须能“理解场景、推理逻辑、做出判断”。 这正是多模态大模型从“看得见”迈向“想得深”的关键跃迁。