Published: October 25, 2025
18
55
208

这篇文章确实是指出了当前 LLM 存在的问题,但解决方案并不见得可行,另外这文章实在太长了点。 如果几句话总结一下,这篇文章主要就是想讲清楚:强化学习(RL)的教父、图灵奖得主 Richard Sutton 到底在担心什么?为什么我们现在的 Agent 这么“笨”?以及,我们该如何跨过这道鸿沟? Sutton 就是“AI

Image in tweet by 宝玉

@dotey 持续学习还要解决的一个问题就是数据效率的问题,Yann Lecun一直强调的一点是,人类的学习效率是现在的模型效率是1000倍,效率低,在奖励稀疏的现实环境,就很难学习。

@suwakopro 对,现在大家都看到了相同的问题,只是被验证的简单可行的方案可能还没出来

@dotey 宝玉老师,这个post内容是用AI对原文处理过的吗,能分享下提示词吗

@jasongyang365 不完全是AI,提示词可以参考:学术论文科普 https://baoyu.ai/blog/turn-aca...

@dotey 确实挺长的 我读了很久 这个双LoRA实践是非常重要的 一方面能提高学习效率 另外一方面它会对抗一些只获得结果而未预测过程所导致的结果主义错误 边听边想边干也应该是一种常见的学习模式,人类就是这样的

@Yangyixxxx “人类就是这样” 不等于 “AI 就能这样”,技术上还是有鸿沟的

@dotey AI無法理解世界怎麼運轉的是因為AI無法理解人,理解必須在社會關係中,否則就理解不了。這個關係第一步就是人的「感性具體」,即人通過感官體驗。比如顏色AI無法理解,因為伽利略就說過光什麼都不是。正如你無法給天生盲人講解紅色一樣。

@dotey 有点意思,自我更新的agent才是好agent。

@dotey LLM本来就是基于概率去猜嘛,当然有天花板了,本质上它的上限就是人类已知知识集合,这个模式无法实现真正的理解,我认为要达到这个高度,光靠CS是不够的,可能还得要脑科学的发展

@dotey 古往今来多豪杰 唯待圣人点玄机 这句预言大概就是为ai世界解决语言幻觉预留的玄机,解决语言文字的底层逻辑,语素基因

@dotey 这里的双Lora策略和前两天meta的agent learning via early experience里面的学习方式很像,都是分别更新agent对环境,以及自身的认知

@dotey 是不是Sutton对LoRA有什么误解😂,LoRA也需要有不少高质量的样本,比方说500个具有代表性且多样化的Q&A。

@dotey 不同意。人类的智慧也是在与世界“有限”的交互 中习得的,基因就是强化学习的产物。现在的llm只是没有和世界交互的海量数据,如果有,按照原来的训练方式,一定可以更智能,超越人类成为AGI

@dotey 自由能原理可以解释LLM为什么这么笨?人类是主动预测,LLM是被动推理. 人类是先有答案再验证答案对错,LLM是先搞清楚问题再检索最可能的答案.人类发现错了会更新自己的world model. LLM发现错了会笑着陪不是但死不悔改,直到升级为更高版本

@dotey 在这个持续学习的过程中,怎么对外部环境和领域知识有效建模也是一个亟待解决的难题

@dotey 很有道理

@dotey 我觉得两位大神可能也要换下思路,机器不是人,不可能靠模仿人的方式来超越人,机器有自己特定的优势,用适合机器的方式才能超越人

@dotey 想持续学习目前的学习架构是无法实现的,甚至要移除bp这种技术导致训练与推理隔离,为什么我觉得BP是通往AGI的绊脚石

Share this thread

Read on Twitter

View original thread

Navigate thread

1/19