DeepMind 那帮人搞出的 Faraday 真的能让科研效率原地
说实话,看到 Inherent 宣称他们的 AI Agent Faraday 在复现科研论文方面的表现能超过 Anthropic 和 OpenAI 时,我第一反应是这又是在搞什么营销噱头。毕竟现在大模型厂商动不动就说自己“超越了人类专家”,这种话听多了确实容易免疫。
但仔细拆解一下 Inherent 这个团队的背景,你会发现这事儿确实有点意思。这帮人全是 DeepMind 的前员工,他们做的 Faraday 并不是那种只会写写代码、调侃两句的聊天机器人,而是一个定位为“AI Teammate”的科研助手。它的核心逻辑在于“复现(Replication)”。
在科研领域,复现一个实验结果往往比写出论文本身还要痛苦。很多时候论文里只给了核心逻辑,但具体的超参数设置、环境依赖或者某种微妙的数据预处理细节,如果不经过大量的试错,根本跑不出来。Faraday 试图解决的就是这个痛点:它能理解论文里的逻辑,然后自主去构建环境、调试代码,直到复现出论文里描述的结果。
我个人比较关注的是它在处理“不确定性”时的逻辑。传统的 LLM 在遇到论文里描述模糊的地方时,往往会开始一本正经地胡说八道(幻觉),但一个真正的科研 Agent 需要的是严谨的实验闭环。如果它真的能像他们吹的那样,在复现成功率上压过 Claude 3.5 或 GPT-4o,那说明它在长程规划和工具调用(Tool Use)的稳定性上有了质的突破。
当然,目前这种说法还停留在实验室阶段的对比。科研的复杂程度远超简单的代码执行,尤其是涉及生物、化学这种需要物理实验配合的领域,Faraday 到底能走多远,还得看它在真实科研工作流中的实操表现。如果只是在现成的 Python 脚本上玩玩,那离真正的“科研队友”还差得远。
事件追踪 · 相关报道
人类学习语言的效率到底比大模型高多少倍
3小时前
大模型水印真的不是在回复里塞广告
1天前
卡塞尔棋子事件背后的法律陷阱
1天前
Anthropic 这次上市文件要是真把 AI 舆论风险写进去
1天前
AI 股市泡沫这事儿,真不用看华尔街研报
2天前
Anthropic 要改企业数据留存策略了
2天前
免费 AI 工具箱 · 全部完全免费
同类方向的延伸案例可以参考AI大模型变现案例库,有不少直接可参考的案例。