运行
run
/ar:run — 单次实验迭代
执行恰好一次实验迭代:回顾历史 $\rightarrow$ 决定变更 $\rightarrow$ 编辑 $\rightarrow$ 提交 $\rightarrow$ 评估。
用法
code
/ar:run engineering/api-speed # 运行一次迭代
/ar:run # 列出实验,由用户选择执行流程
第 1 步:确定实验
如果未指定实验,运行 python {skill_path}/scripts/setup_experiment.py --list 并请用户选择。
第 2 步:加载上下文
bash
# 读取实验配置
cat .autoresearch/{domain}/{name}/config.cfg
读取策略和约束
cat .autoresearch/{domain}/{name}/program.md
读取实验历史
cat .autoresearch/{domain}/{name}/results.tsv
切换到实验分支
git checkout autoresearch/{domain}/{name}第 3 步:决定尝试方案
审查 results.tsv:
- 哪些变更被保留了?它们有什么共同模式?
- 哪些被舍弃了?避免重复这些方法。
- 哪些崩溃了?分析原因。
- 目前运行了多少次?(据此升级策略)
策略升级路径:
- 第 1-5 次:低垂果实(明显的改进)
- 第 6-15 次:系统性探索(改变单个参数)
- 第 16-30 次:结构性变更(更换算法)
- 第 30 次以上:激进实验(完全不同的方法)
第 4 步:进行一次变更
仅编辑 config.cfg 中指定的目标文件。只改动一处,保持简单。
第 5 步:提交并评估
bash
git add {target}
git commit -m "experiment: {变更内容的简短描述}"
python {skill_path}/scripts/run_experiment.py \
--experiment {domain}/{name} --single
第 6 步:报告结果
读取脚本输出。告知用户:
- 保留 (KEEP): "有提升!{metric}: {value} (比之前最佳提升 {delta})"
- 舍弃 (DISCARD): "无提升。{metric}: {value} vs 最佳 {best}。已回滚。"
- 崩溃 (CRASH): "评估失败:{reason}。已回滚。"
第 7 步:自我改进检查
每完成 10 次实验(检查 results.tsv 的行数),根据学到的模式更新 program.md 的 Strategy 部分。
规则
- 每次迭代仅限一次变更。不要一次性修改 5 处。
- 绝不要修改评估器 (evaluate.py)。它是基准真相。
- 简单至上。性能相同但代码更简洁即视为改进。
- 不引入新的依赖。