返回 综合资讯_热点资讯—爱榴莲

当大模型把题库“刷爆”,红杉中国推出一套全新AI基准测试

2025-05-26
     


类似手机时代厂商发布新机需要“跑个分”,如今大模型厂商发布新产品后也会通当大模型把题库“刷爆”,红杉中国推出一套全新AI基准测试过基准测试(Benchmark)跑分对比,但随着基础模型的快速发展和AI Agent(智能体)进入规模化应用阶段,被广泛使用的基准测试开始面临一个日益尖锐的问题:真实反映AI的客观能力变得越来越难。

5月26日,红杉中国宣布推出一款全新的AI基准测试工具xbench,由红杉中国发起,联合国内外十余家高校和研究机构的数十位博士研究生,采用双轨评估体系和长青评估机制。

双轨评估体系是指构建多维度测评数据集,同时追踪模型的理论能力上限与Agent的实际落地价值。长青评估机制是指动态的、持续更新的评估方法。此前行业模型进行榜单成绩对比时,会面临“刷榜”质疑。即静态评估集会出现题目泄露问题,模型反复测试可以将分数“刷”上去。

最新文章

灰裙配格纹!祝绪丹松弛造型氛围感拉满

娱乐

 

阅读11221

簪花映素裙!虞书欣新造型端庄大气美出圈

娱乐

 

阅读10240

工装配金饰!周也田园造型笑容治愈氛围感拉满

娱乐

 

阅读19122

绣球映笑颜!张婧仪新剧花絮照笑容甜美氛围感拉满

娱乐

 

阅读14539

萌娃遇冠军!小酒窝武大靖合拍手势舞超可爱

娱乐

 

阅读18811

2024 iliulians.cn 冀ICP备20014711号-3