🤖Qwen2.5-Coder-32B 模型能力数据
2025-5-22
| 2025-6-3
字数 382阅读时长 1 分钟

Qwen2.5-Coder-32B 模型能力数据(搜索整合自网络)

基本信息

  • 模型名称:Qwen2.5-Coder-32B
  • 参数量:32.5B(非嵌入参数:31.0B)
  • 上下文长度:128K tokens
  • 许可证:Apache 2.0
  • 发布日期:2024年11月12日

编程能力评测

代码生成

  • 在多个流行的代码生成基准(如EvalPlus、LiveCodeBench、BigCodeBench)上取得了开源模型中的最佳表现
  • 达到与GPT-4o有竞争力的表现

代码修复

  • Aider基准测试:73.7分,与GPT-4o相当
  • MdEval(多编程语言代码修复基准):75.2分,在所有开源模型中排名第一

代码推理

  • 在CRUXEval基准上达到与GPT-4o、Claude 3 Opus相当的水平

多编程语言支持

  • 支持92种编程语言
  • McEval基准测试:65.9分
  • 在Haskell、Racket等特定语言上表现尤为出色

代码补全能力

  • 在Humaneval-Infilling、CrossCodeEval、CrossCodeLongEval、RepoEval、SAFIM等5个评测集上取得SOTA表现

人类偏好对齐

  • 在内部标注的代码偏好评估基准Code Arena上表现优异

与其他模型的对比

从官方页面的雷达图可见,Qwen2.5-Coder-32B-Instruct与以下模型进行了对比:
  • GPT-4o-20240806
  • DeepSeek-Coder-33B-Instruct
  • DeepSeek-Coder-V2-Instruct
  • CodeStral-22B
在多个基准测试中,Qwen2.5-Coder-32B-Instruct与GPT-4o表现接近或超越,在12个主流基准上与GPT-4o对决,斩获9胜。

模型架构与技术细节

  • 层数:64
  • 注意力头:40 / 8 (KV)
  • 不绑定嵌入层
  • qwen
  • 工具
  • Qwen2.5-Coder-32B与主流旗舰模型全面对比分析报告Gemini 发音探讨
    Loading...