AI写的网页到底能不能用?腾讯做了个会自己点网页的评测
发布时间:2026-09-20
动察 Beating AI 快讯,腾讯混元联合清华、北大推出 IWC-Bench,专门评测 AI 生成的网页实际用起来怎么样。不少网页生成评测主要看代码或截图。页面可能看起来很漂亮,代码里也确实写了功能,但按钮点不开、表单交不了、切个页面就报错,这些问题很难靠静态检查发现。IWC-Bench 更像真人验收。它让一个 Agent 真正打开网页,点击按钮、输入内容、切换页面,再检查哪些功能实际跑过。最后分别评价三件事:页面好不好看、操作顺不顺、用户要求的功能有没有做出来。基准收录 369 条真实用户需求和 5088 条验收标准,17 个模型一共生成了 6273 个网页应用。在另外 197 组人工复核的对比中,IWC-Bench 有 168 组和人类选择一致,一致率达到 85.3%。结果也说明,网页「看起来不错」和「真的好用」不是一回事。GPT-5.6-Sol 的页面美观度最高,但易用性只排第六;具体到单个网页,好看基本不能说明它好不好用,两项相关系数只有 0.36。----------缘辉旺盾网量化工具温馨提示:数字货币投资有风险,入市需谨慎;本文章不作为投资依据,仅供参考----------交流群:https://t.me/dunwangyuanhuiwang

动察 Beating AI 快讯,腾讯混元联合清华、北大推出 IWC-Bench,专门评测 AI 生成的网页实际用起来怎么样。


不少网页生成评测主要看代码或截图。页面可能看起来很漂亮,代码里也确实写了功能,但按钮点不开、表单交不了、切个页面就报错,这些问题很难靠静态检查发现。


IWC-Bench 更像真人验收。它让一个 Agent 真正打开网页,点击按钮、输入内容、切换页面,再检查哪些功能实际跑过。最后分别评价三件事:页面好不好看、操作顺不顺、用户要求的功能有没有做出来。


基准收录 369 条真实用户需求和 5088 条验收标准,17 个模型一共生成了 6273 个网页应用。在另外 197 组人工复核的对比中,IWC-Bench 有 168 组和人类选择一致,一致率达到 85.3%。


结果也说明,网页「看起来不错」和「真的好用」不是一回事。GPT-5.6-Sol 的页面美观度最高,但易用性只排第六;具体到单个网页,好看基本不能说明它好不好用,两项相关系数只有 0.36。

----------缘辉旺盾网量化工具温馨提示:数字货币投资有风险,入市需谨慎;本文章不作为投资依据,仅供参考 ----------交流群:https://t.me/dunwangyuanhuiwang