Qwen发布QwQ-32B,强化学习推动开源推理模型走向工具调用
3月6日,通义千问团队发布QwQ-32B,并以Apache 2.0许可证开放模型权重。该模型参数规模为320亿,重点面向数学、代码和通用问题求解。Qwen官方表示,QwQ-32B在多项公开评测中的表现可与参数规模更大的DeepSeek-R1相比较,但相关结果仍属于厂商测试口径。
此次发布的核心方向是扩大强化学习在推理模型中的作用。团队先针对数学和代码任务使用结果奖励训练,再加入通用能力强化学习,以改善指令遵循、人类偏好对齐和智能体任务表现。模型还被加入工具使用能力,可根据外部工具返回的信息继续调整推理过程。
对于企业用户,开放权重意味着可以在自有环境中测试、部署和二次适配推理能力,减少敏感数据在外部平台流转。但推理模型通常会产生更长输出,也可能带来更高延迟和计算成本。正式选型时,应结合真实业务样本比较准确率、等待时间、硬件投入和人工复核成本。
*本文为基于官方发布信息的中文摘要,详情以原文链接为准。