Banbury Road让32个模型一起练,自己形成不同专长
发布时间:2026-10-07
动察 Beating AI 快讯,AI 实验室 Banbury Road 发布 Kardashev-0.7,由 32 个不同模型组成。团队用强化学习一起训练这些模型,不提前规定各自负责什么,让它们在训练中形成不同专长和互补能力。这套方法被称为 RL for Population Scaling(RLPS)。此前的 RLPS 实验最多做到 16 个模型。在 8 模型实验中,共同训练后的模型群体得分为 81.70%,高于 8 个独立训练模型的 71.04%,也高于同一个模型重复采样 8 次的 72.65%。在 16 模型实验中,有 22 道题只有其中 1 个模型答对,说明不同模型确实学出了不同能力。Kardashev-0.7 把规模扩大到 32 个模型。Banbury Road 称,它能以 0.007 至 0.02 倍的推理成本、0.03 倍的内存达到前沿模型级表现。目前 API Beta 仍需要加入候补名单。不过,此前 8 和 16 模型实验里的群体成绩,是事后用标准答案从多个模型输出中选出最好结果。实际使用时没有标准答案,系统怎么自动挑出正确回答,Banbury Road 还没有公开完整方案。----------缘辉旺盾网量化工具温馨提示:数字货币投资有风险,入市需谨慎;本文章不作为投资依据,仅供参考----------交流群:https://t.me/dunwangyuanhuiwang

动察 Beating AI 快讯,AI 实验室 Banbury Road 发布 Kardashev-0.7,由 32 个不同模型组成。团队用强化学习一起训练这些模型,不提前规定各自负责什么,让它们在训练中形成不同专长和互补能力。这套方法被称为 RL for Population Scaling(RLPS)。


此前的 RLPS 实验最多做到 16 个模型。在 8 模型实验中,共同训练后的模型群体得分为 81.70%,高于 8 个独立训练模型的 71.04%,也高于同一个模型重复采样 8 次的 72.65%。在 16 模型实验中,有 22 道题只有其中 1 个模型答对,说明不同模型确实学出了不同能力。


Kardashev-0.7 把规模扩大到 32 个模型。Banbury Road 称,它能以 0.007 至 0.02 倍的推理成本、0.03 倍的内存达到前沿模型级表现。目前 API Beta 仍需要加入候补名单。


不过,此前 8 和 16 模型实验里的群体成绩,是事后用标准答案从多个模型输出中选出最好结果。实际使用时没有标准答案,系统怎么自动挑出正确回答,Banbury Road 还没有公开完整方案。

----------缘辉旺盾网量化工具温馨提示:数字货币投资有风险,入市需谨慎;本文章不作为投资依据,仅供参考 ----------交流群:https://t.me/dunwangyuanhuiwang