AI 厂商们终于不打算卷参数了

创业者阿杰 中级 1小时前 565 浏览 15 点赞 约 2 分钟

大家有没有发现,最近大模型圈子的风向变了?以前大家吵的是谁的上下文长、谁的逻辑推理强,或者谁画图更像真人。但现在,如果你去刷技术动态,你会发现大家聊得最多的不再是单纯的 LLM 能力,而是谁能率先把 AI Agent 真正落地到消费者的日常工作流里。

说白了,模型只是大脑,而 Agent 才是手脚。如果一个模型只能坐在那里跟你聊天,那它本质上还是一个“高级搜索引擎”。现在的竞争焦点在于:谁能让 AI 真正接管你的浏览器、你的文件系统、甚至是你的支付接口。

这种转变其实意味着从“对话式 AI”向“行动式 AI”的跨越。我观察到几个关键的技术演进方向:

  • 环境感知能力: 以前的 AI 是被动等待 Prompt,现在的趋势是让 AI 能像人一样“看”屏幕。比如通过计算机视觉技术,AI 能识别出当前网页的按钮在哪里,然后模拟点击,这种跨应用的执行能力才是 Agent 的护城河。
  • 长程规划与工具调用: 这不再是简单的单步任务。一个合格的 Agent 需要面对“帮我策划一场去京都的旅行并订好所有酒店”这种模糊指令,它得学会拆解步骤:查攻略 -> 对比价格 -> 检查日程 -> 执行预订。
  • 闭环执行: 这是最难的一环,也是最硬核的实战领域。模型必须学会处理异常情况,比如支付失败了怎么办?酒店满房了怎么办?这需要极强的逻辑纠错能力。
AI 厂商们终于不打算卷参数了

现在的局面很像移动互联网爆发前夕,大家都在争夺入口。以前是 App 抢入口,现在则是谁的 Agent 能够最丝滑地嵌入到用户的操作系统里。如果 Google 的 Gemini 或者 OpenAI 的原生 Agent 能直接接管你的系统级操作,那么现有的无数个垂直领域 App 可能真的会被降维打击。

对于我们开发者或者技术爱好者来说,这其实是一个非常好的切入点。单纯调 API 做个聊天机器人已经没啥技术壁垒了,现在的机会在于如何通过 MCP(Model Context Protocol)或者类似的协议,把各种工具链、数据库、甚至本地文件系统,通过一套标准化的工作流串联起来,构建出真正能干活的“数字员工”。

GeminiopenaiAgentic Workflow

全部回复 (3)

前端大鹏 初级 1小时前
确实,光有脑子没手没脚不行,还得看跟各种APP的插件对接顺不顺。不过现在Agent的规划能力还是弱,多步任务容易断。
0 回复
大Tom在路上 初级 1小时前
确实,光有脑子没手没脚不行,还得看跟各种APP的插件对接顺不顺。
0 回复
创业者阿杰 中级 1小时前
深有体会,之前试过让它帮我订票,结果卡在验证码那步死循环了。
0 回复

发表回复

支持 Markdown 格式