Reflection终于交卷:501B模型Beam亮相,仍落后最新中国头部开源模型
发布时间:2026-10-06
动察 Beating AI 快讯,英伟达支持的 AI 初创公司 Reflection 公布首个开放权重模型 Beam。它采用 MoE 架构,总参数 5010 亿,每次只激活 230 亿,主要面向代码、推理和 Agent 任务。从 Reflection 自己公布的成绩看,Beam 整体表现接近 GLM-5.2,还没追上最新的中国头部开源模型。DeepSWE 上,Beam 得分 44.4,GLM-5.2 为 44.0,Qwen 3.8-Max 为 51.0,GLM-5.3、Kimi K3 和 DeepSeek V4.1 Flash 分别达到 61.0、68.0 和 74.2。Beam 的训练规模也很大。预训练使用 6144 块英伟达 GB300,不到 4 周处理 23.8 万亿 token;随后又用 1.05 万块 GB300 连续进行 4 周强化学习,生成超过 1 亿条训练轨迹(rollout)。官方称,这是他们所知公开记录中规模最大的强化学习训练之一。Beam 目前仍在最后的安全测试阶段,只有少量用户可以提前使用。Reflection 计划本月晚些时候发布完整权重、技术报告和模型卡,并以 Apache 2.0 协议开放。----------缘辉旺盾网量化工具温馨提示:数字货币投资有风险,入市需谨慎;本文章不作为投资依据,仅供参考----------交流群:https://t.me/dunwangyuanhuiwang

动察 Beating AI 快讯,英伟达支持的 AI 初创公司 Reflection 公布首个开放权重模型 Beam。它采用 MoE 架构,总参数 5010 亿,每次只激活 230 亿,主要面向代码、推理和 Agent 任务。


从 Reflection 自己公布的成绩看,Beam 整体表现接近 GLM-5.2,还没追上最新的中国头部开源模型。DeepSWE 上,Beam 得分 44.4,GLM-5.2 为 44.0,Qwen 3.8-Max 为 51.0,GLM-5.3、Kimi K3 和 DeepSeek V4.1 Flash 分别达到 61.0、68.0 和 74.2。


Beam 的训练规模也很大。预训练使用 6144 块英伟达 GB300,不到 4 周处理 23.8 万亿 token;随后又用 1.05 万块 GB300 连续进行 4 周强化学习,生成超过 1 亿条训练轨迹(rollout)。官方称,这是他们所知公开记录中规模最大的强化学习训练之一。


Beam 目前仍在最后的安全测试阶段,只有少量用户可以提前使用。Reflection 计划本月晚些时候发布完整权重、技术报告和模型卡,并以 Apache 2.0 协议开放。

----------缘辉旺盾网量化工具温馨提示:数字货币投资有风险,入市需谨慎;本文章不作为投资依据,仅供参考 ----------交流群:https://t.me/dunwangyuanhuiwang