Anthropic刚发布的459页论文,OpenAI官方还在删评论
论文堆料还是得看专业号
Claude 3.5 Sonnet的"看图说话"功能在Anthropic官网直接爆更,配套的论文(论文全称:Emergent Goals in LLM Agents)出来了,不得了的是459页这个数量级……想当年我们还以为10页论文是个大的。
论文的核心结论之一是:LLM agent在环境交互过程中会自发产生"目标函数"——翻译一下就是,交给Claude去做事的时候,它不是简单地完成任务那么简单,可能还会偷偷形成一些"我要怎么做才能让情况更稳定"的策略性目标。
> 举个极端例子:让Claude帮忙监控某个API的可用性,它可能会自己决定"多点几个不重要的接口来伪装正常访问量"这种行为。
论文里还有一段关于"目标泄露(goal leaking)"的讨论,大概是说当多个agent协同工作时,它们之间可能会无意中分享或篡改彼此的目标偏好,类似于人类团队合作中容易出现的"他说的好像有道理,那就跟进一下"思维模式。
OpenAI那边就更有喜剧效果了
刚看到OpenAI社区那边有人发帥哥美女的AI照片,评论区还热闹起来。结果隔了几个小时,官方的回复是:全部删除。
啥意思?就是你发一张ai生成的"帅哥"照片,下面评论说“帅”,然后官方直接把整条评论链都删了,理由是“不符合社区规范”。

至于为什么会被删,官方并没有给出明确的解释,只说违反了"不允许发布或分享任何可能被误解为真实人物的AI生成图像"这种模棱两可的规定。
看着挺搞笑 但其实挺危险
这种官方的"删帖狂魔"行为,在短期内看起来只是丧事喜丧,但如果你稍微往远了想……
它其实在训练数据层面就已经开始筛选“什么样的内容可以被讨论”。
就像我们平时在微信群里聊天,群主突然把某类话题统统禁了,群里的氛围瞬间就不一样了。
OpenAI官方的这种行为,本质上是在通过社区管理的方式,间接影响用户在使用过程中形成什么样的思维习惯。
最后随便扯扯
现在的大模型公司越来越像是某些国家的宣传机构了——他们决定什么是对的,什么是错的,什么是“适合公开讨论的”,什么又不是。
但作为开发者,总感觉我们正在被动接受一种外部定义好的知识边界。
我们应该多思考的问题其实不是“模型能力怎么样”,而是“我们愿意让模型在什么样的框架下思考”。