News
首页  -  资讯  - 
字节 Seed 社区驱动 EdgeBench 基准测试
字节 Seed 发布消息称推出了用于衡量真实世界环境学习的超长程评测集 EdgeBench。该评测集包含 134 个真实且多样的任务,横跨六大能力领域,Agent 在每个任务上都可持续工作至少 12 小时。其中 51 个任务及完整评测框架已开源。 “基于这些任务上的长程环境交互运行结果,我们发现,Agent 在“环境学习”过程中的整体表现遵循一条高精度的 log-sigmoid 曲线,平均拟合精度...

字节 Seed 发布消息称推出了用于衡量真实世界环境学习的超长程评测集 EdgeBench。该评测集包含 134 个真实且多样的任务,横跨六大能力领域,Agent 在每个任务上都可持续工作至少 12 小时。其中 51 个任务及完整评测框架已开源。

“基于这些任务上的长程环境交互运行结果,我们发现,Agent 在“环境学习”过程中的整体表现遵循一条高精度的 log-sigmoid 曲线,平均拟合精度 R² 达到 0.998。同时,从不同代际的前沿模型来看,Agent 的学习速度大致呈现出每三个月翻一倍的趋势。”

根据介绍,EdgeBench 在任务设计上呈现以下特点:

面向环境学习:每个工作区、反馈信号和评测器都贴近真实实践,分数体现了 Agent 在环境中的学习和改进情况。超长时程:每个任务都兼容 12 小时以上的连续运行,部分延长实验超过 72 小时,让经验能够持续累积。从已记录人工投入的任务来看,人类专家完成单个任务所需的时间平均为 57.2 小时,最高达到 320 小时。覆盖六大领域:134 个任务覆盖了科学、复杂软件工程、白领知识工作、处理逻辑增强、前沿数学和数字游戏,并由领域专家结合真实问题持续迭代,其中超 90% 任务为全新构建。

配图