JetBrains开源Mellum2.1:LiveCodeBench测试超过Qwen3.5-9B
发布时间:2026-10-09
动察 Beating AI 快讯,JetBrains 发布开源编程模型 Mellum2.1。与今年 6 月推出的 Mellum2 相比,新版总参数仍为 120 亿,每次生成只激活 25 亿,但更擅长查找代码问题、修改文件并检查结果。JetBrains 没有改动模型架构,主要靠强化学习提升能力。团队在数千种环境中运行了数百万次沙盒任务。训练时,模型在真实代码仓库中调用终端和文件编辑工具,成功通过测试便能获得奖励。JetBrains 自测显示,SWE-bench Verified(真实软件问题修复测试)的成功率从旧版 2% 升至 47%,略低于 Qwen3.5-9B 的 50%。但在 LiveCodeBench v6 编程测试中,Mellum2.1 得分 82%,超过 Qwen 的 75.4%。JetBrains 还称,在单张 H200 上高负载运行时,新模型的输出吞吐量接近 Qwen3.5-9B 的两倍。模型权重及 GGUF 量化版已在 Hugging Face 开放,采用 Apache 2.0 许可,可供开发者本地部署。----------缘辉旺盾网量化工具温馨提示:数字货币投资有风险,入市需谨慎;本文章不作为投资依据,仅供参考----------交流群:https://t.me/dunwangyuanhuiwang

动察 Beating AI 快讯,JetBrains 发布开源编程模型 Mellum2.1。与今年 6 月推出的 Mellum2 相比,新版总参数仍为 120 亿,每次生成只激活 25 亿,但更擅长查找代码问题、修改文件并检查结果。


JetBrains 没有改动模型架构,主要靠强化学习提升能力。团队在数千种环境中运行了数百万次沙盒任务。训练时,模型在真实代码仓库中调用终端和文件编辑工具,成功通过测试便能获得奖励。


JetBrains 自测显示,SWE-bench Verified(真实软件问题修复测试)的成功率从旧版 2% 升至 47%,略低于 Qwen3.5-9B 的 50%。但在 LiveCodeBench v6 编程测试中,Mellum2.1 得分 82%,超过 Qwen 的 75.4%。JetBrains 还称,在单张 H200 上高负载运行时,新模型的输出吞吐量接近 Qwen3.5-9B 的两倍。


模型权重及 GGUF 量化版已在 Hugging Face 开放,采用 Apache 2.0 许可,可供开发者本地部署。

----------缘辉旺盾网量化工具温馨提示:数字货币投资有风险,入市需谨慎;本文章不作为投资依据,仅供参考 ----------交流群:https://t.me/dunwangyuanhuiwang