Qwen2.5-Coder-32B 模型能力数据(搜索整合自网络)
基本信息
- 模型名称:Qwen2.5-Coder-32B
- 参数量:32.5B(非嵌入参数:31.0B)
- 上下文长度:128K tokens
- 许可证:Apache 2.0
- 发布日期:2024年11月12日
编程能力评测
代码生成
- 在多个流行的代码生成基准(如EvalPlus、LiveCodeBench、BigCodeBench)上取得了开源模型中的最佳表现
- 达到与GPT-4o有竞争力的表现
代码修复
- Aider基准测试:73.7分,与GPT-4o相当
- MdEval(多编程语言代码修复基准):75.2分,在所有开源模型中排名第一
代码推理
- 在CRUXEval基准上达到与GPT-4o、Claude 3 Opus相当的水平
多编程语言支持
- 支持92种编程语言
- McEval基准测试:65.9分
- 在Haskell、Racket等特定语言上表现尤为出色
代码补全能力
- 在Humaneval-Infilling、CrossCodeEval、CrossCodeLongEval、RepoEval、SAFIM等5个评测集上取得SOTA表现
人类偏好对齐
- 在内部标注的代码偏好评估基准Code Arena上表现优异
与其他模型的对比
从官方页面的雷达图可见,Qwen2.5-Coder-32B-Instruct与以下模型进行了对比:
- GPT-4o-20240806
- DeepSeek-Coder-33B-Instruct
- DeepSeek-Coder-V2-Instruct
- CodeStral-22B
在多个基准测试中,Qwen2.5-Coder-32B-Instruct与GPT-4o表现接近或超越,在12个主流基准上与GPT-4o对决,斩获9胜。
模型架构与技术细节
- 层数:64
- 注意力头:40 / 8 (KV)
- 不绑定嵌入层