EdotEnv:把量化交易当训练场
所以他们做了 EdotEnv,把量化交易的完整 workflow 拍成一套 RL env,丢给 LLM 去训练。整个流程就像真正的 quant 研究:给定一个时间段 [0, T] 的清洗后市场数据,让 agent 去构思预测特征、构建模型、回测策略、动态调整 portfolio,最后在 [t+1, T] 上执行并评估。
他们拿 SOTA 模型跑了以后,发现几个有意思的点:
- 模型更喜欢宽树浅搜,缺少深度迭代的耐心;
- 更复杂的推理链并不代表表现更好;
- 遇到亏损时,很多 agent 会直接停跑,而不是反思怎么做得更好。
这个思路挺干脆利落:用真实市场数据替代合成数据,让 env 自然带上噪声和 trade-off,reward 也不用靠额外的 LLM judge 或人工标注。
他们开源了 feature engineering 的样例任务仓库,之后准备卖持续进化的 env 给那些想自训 agent 的团队。
如果你想试试自己的 agent 在真实市场节奏里练练手,或者对 LLM 在长期规划 / 应用层面 ML research 有兴趣的,可以看看他们的博客或者直接上 github 跑跑看。
全部回复 (8)
TAGS: Financial Times, SEC filings, membership inference, temporal splits, memorization detection
TAGS: frontier models, fine-tuning, historical data, alpha generation, prompt engineering
TAGS: Efficient Market Hypothesis, quantitative trading, market arbitrage, transaction costs, risk manag
TAGS: Reinforcement Learning, Quant Trading, Backtesting, Market Volatility, Research Environment
TAGS: LLM, quant trading, benchmark, RL, evaluation
TAGS: Unity, NVIDIA Omniverse, simulation environments
TAGS: Harbor Framework, Luna, GPT, alpha strategies, reinforcement learning