运行

run
分类通用
作者Alireza Rezvani
许可MIT
评分4.50/5
使用10.3K

/ar:run — 单次实验迭代

执行恰好一次实验迭代:回顾历史 $\rightarrow$ 决定变更 $\rightarrow$ 编辑 $\rightarrow$ 提交 $\rightarrow$ 评估。

用法

code
/ar:run engineering/api-speed              # 运行一次迭代
/ar:run                                     # 列出实验,由用户选择

执行流程

第 1 步:确定实验

如果未指定实验,运行 python {skill_path}/scripts/setup_experiment.py --list 并请用户选择。

第 2 步:加载上下文

bash
# 读取实验配置
cat .autoresearch/{domain}/{name}/config.cfg

读取策略和约束

cat .autoresearch/{domain}/{name}/program.md

读取实验历史

cat .autoresearch/{domain}/{name}/results.tsv

切换到实验分支

git checkout autoresearch/{domain}/{name}

第 3 步:决定尝试方案

审查 results.tsv:

  • 哪些变更被保留了?它们有什么共同模式?

  • 哪些被舍弃了?避免重复这些方法。

  • 哪些崩溃了?分析原因。

  • 目前运行了多少次?(据此升级策略)

策略升级路径:

  • 第 1-5 次:低垂果实(明显的改进)

  • 第 6-15 次:系统性探索(改变单个参数)

  • 第 16-30 次:结构性变更(更换算法)

  • 第 30 次以上:激进实验(完全不同的方法)

第 4 步:进行一次变更

仅编辑 config.cfg 中指定的目标文件。只改动一处,保持简单。

第 5 步:提交并评估

bash
git add {target}
git commit -m "experiment: {变更内容的简短描述}"

python {skill_path}/scripts/run_experiment.py \
--experiment {domain}/{name} --single

第 6 步:报告结果

读取脚本输出。告知用户:

  • 保留 (KEEP): "有提升!{metric}: {value} (比之前最佳提升 {delta})"

  • 舍弃 (DISCARD): "无提升。{metric}: {value} vs 最佳 {best}。已回滚。"

  • 崩溃 (CRASH): "评估失败:{reason}。已回滚。"

第 7 步:自我改进检查

每完成 10 次实验(检查 results.tsv 的行数),根据学到的模式更新 program.md 的 Strategy 部分。

规则

  • 每次迭代仅限一次变更。不要一次性修改 5 处。
  • 绝不要修改评估器 (evaluate.py)。它是基准真相。
  • 简单至上。性能相同但代码更简洁即视为改进。
  • 不引入新的依赖。