跳转至

路线图

这是一份记录 Arbor 后续优化方向的文档,列出我们关心的几类开放问题及目前的初步设想。 这些问题与设想会随团队认识的深入而调整、合并或删除,欢迎贡献与建议。

方向一:核心功能优化

1. 实验进程管理优化

目前 Arbor 由单一 Coordinator 维护整棵 hypothesis tree,在更长的研究周期下可能出现能力 退化。我们计划优化其上下文管理,使长程研究中积累的关键信息不致逐步失真或丢失。

2. Idea 质量评估

目前提出的 idea,其新颖性与可行性主要依赖基础模型自身的能力,缺乏外部的显式反馈进行 监督。我们考虑引入类似批判者(critic)的角色,对候选 idea 给出独立评估,以提升这一环节 的质量。

3. 自进化能力

目前 Arbor 围绕单一 benchmark 进行优化,所得经验难以迁移到相似或同领域的其他任务。我们 计划增加研究轨迹的导出能力,并在此基础上抽取、整合可复用的技能与经验。

4. 对复合优化目标的支持

当前 Arbor 的优化目标仅支持标量分数。我们考虑支持更复合的目标形式——如 rubric、LLM judge 评分与多目标优化——并相应解决这类目标下的可比较性与防作弊问题。

5. Agent 科研能力的提升

让 Agent 能根据实验进展自主获取更多实验信息,而不局限于预先给定的 metric,从而为后续 决策提供更充分的依据。

方向二:外部资源优化

1. 扩展到更多样化的长程优化场景

现有任务格式假设静态优化(环境固定、无状态)。我们计划增加带环境状态的任务形态,以 支持办公等真实场景下的 agent harness 优化。

2. 自动化环境收集

收集并扩充更全面的 benchmark 场景,覆盖各类 LLM 与 Agent 评测基准,使 Arbor 能支持更广 的优化场景。

方向三:用户体验

1. 扩展更多实际示例与场景

目前免安装 demo 已经落地,但能端到端跑通的示例仅有 algotune_knn 一个。我们计划将其 扩展为一个小型示例画廊,覆盖不同类型的任务与受众(如 Kaggle / MLE、prompt 与 harness 工程、小规模训练等),每个示例配以可复制的命令与简短录屏,并将上手门槛控制在笔记本或 免费 API key 即可在数分钟内跑通。

2. 优化单次自动实验的导出与展示能力

目前已有 REPORT.md、HTML 导出、实时 dashboard 与只读 WebUI,仍缺少对单次实验的理解 与横向对比。我们计划支持 run 之间的对比(对同一任务的多次 run 做 diff,或跨 model / provider 比较 idea tree),在报告中补充引用(每个 idea 背后的文献来源)与成本明细,并为 benchmark 集合提供可复现视图——每一条目均附带可直接复跑的命令。


有想法,或想认领其中一条线索?开一个 discussion,或见 贡献