1. 作者不是神经科学家,是人工智能公司 Bluecore 的创始人之一,他写这本书的原因是他想读这本书

  2. 大语言模型与人类智能的差异:作者将人类智能的演进分为五个阶段,每一阶段都是层叠累积的关系。

  3. 第一阶段智能:双侧动物的**掌舵(Steering)**能力,也就是能够调整前进方向的能力

  4. 第二阶段智能:脊椎动物的**强化(Reinforcing)**学习能力

  5. 已知多巴胺并不会产生愉悦,但为什么老鼠宁愿饿死也要追求多巴胺的刺激?我们把多巴胺的作用叫做强化,它真正的作用是刺激生物追求预期奖励

  6. Schultz 的研究——老鼠按下按钮(cue),5 秒后给糖水(reward)——反映了多巴胺神经元的工作机制

    1. 第一次给予 cue 和 reward,神经元在 reward 出现后活跃
    2. 反复给予 cue 和 reward,神经元在 cue 出现时活跃,reward 时不再活跃
    3. 预期的 reward 没有出现,神经元活动下降(惩罚)
  7. 十年以来,包括 Schultz 在内的神经科学家都不清楚为什么多巴胺神经元的活动会从奖励转向对奖励的预测。直到 Dayan 和 Montague 尝试证明大脑实现了某种形式的时序差分学习(Temporal difference learning,TD learning,一种机器学习算法),当他们看到 Schultz 的数据后,立刻知道这印证了他们的猜想——多巴胺细胞的行为和时序差分学习确实存在相似之处

    1997 年,Dayan 和 Montague 与 Schultz 共同发表了一篇具有里程碑意义的论文,题为“预测和奖励的神经基质”。时至今日,这一发现代表了人工智能和神经科学之间最著名和美丽的合作之一。受 Sutton 关于大脑可能如何工作的思维启发的策略成功克服了人工智能中的实际挑战,这反过来又帮助我们解读了有关大脑的神秘数据。神经科学为人工智能提供信息,而人工智能也为神经科学提供信息。

  8. 多巴胺神经元在进化中起到什么作用?我们总听说多巴胺如何让我们上瘾,仿佛它是有害的,但实际上它赋予了脊椎动物一种比单纯试错更高级的学习机制——缺失(omission)强化:

    1. 预期惩罚的缺失,感到 relieved,正反馈
      1. 鱼类在闪光信号后游向没有电击的一侧,而且学会了不急不慢地在最后一刻冲过去
      2. 意料之外的假期尤其令人兴奋
      3. 动物感受到威胁的信号,却没有真正遇到威胁,这会让它们适应这些信号,节省能量(某些地区动物学会和人类和平共处)
    2. 预期奖励的缺失,感到 disappointed,负反馈
      1. 训练宠物狗,如果每次都给予奖励,效果反而会比较差
      2. 候鸟每年春季迁徙到北方繁殖,但气候变化导致昆虫孵化时间提前,到达时食物减少,于是一些鸟类开始提前迁徙,更好地适应了变化
      3. 幼崽由于疾病或天敌死亡,母亲会悲伤和焦虑,并在未来更加谨慎地照顾后代
  9. 多巴胺这种神奇的机制使脊椎动物们不仅能通过实践(试错)学习,还能通过想象(relieved 或 disappointed 的感受)学习。

    Dopamine is not a signal for reward but for reinforcement. As Sutton found, reinforcement and reward must be decoupled for reinforcement learning to work. To solve the temporal credit assignment problem, brains must reinforce behaviors based on changes in predicted future rewards, not actual rewards.

    多巴胺不是奖励的信号,而是强化(reinforcement)的信号。强化学习算法中存在的一个挑战是如何解决时序信用分配问题(the temporal credit assignment problem,即如何确定智能体过去的哪些行动对当前奖励的贡献最大),我们必须将强化和奖励解耦,基于预期结果的变化强化行为,而非基于奖励强化行为。

  10. 另一个机制共同发挥了作用——好奇心。适当的好奇心对基因延续是有益的。这也能解释赌徒心态——下注的动作会刺激多巴胺分泌

  11. 可以说,通过变相让 AI 拥有 relieved, disappointed 和 curious 的感受,在推动智能涌现的过程中发挥了关键作用

  12. 第三阶段智能:第一批哺乳动物的**新皮层(neocortex)带来的模拟(simulating)**能力。或者说想象力——渲染未来可能性和重温过去事件的能力。人类大脑的新皮层很大,像毛巾一样有褶皱,展开来能铺满一张小桌子

  13. 新皮层使动物具备了在行动之前模拟动作的能力。把鱼放在玻璃隔板隔开的水箱里几天,隔板上有个小洞,熟悉环境后,放块食物在另一边,它还是不知道要绕一下穿过洞去获取食物,这是因为它不具备模拟能力,而老鼠的表现好多了,它会在迷宫入口停顿思考,通过脑中建立的环境的模型,知道走哪条路能获取到食物

  14. 在十九世纪,一位名叫赫尔曼·冯·亥姆霍兹(Helmholtz)的德国物理学家提出人脑具备推断(inference)的能力。嘈杂的电话里你也能听清对方在说什么;著名的「鸭与兔」图像……大脑会自动填补缺失的部分,把信息解释成自己熟悉的东西。人机识别图也利用了这一点。人们都同意亥姆霍兹的推断理论,但要一个世纪后才知道它究竟是如何运作的

  15. 传统的机器学习训练方式都是监督式学习,即人类告诉模型图片是什么东西。而 1995 年机器学习科学家 Hinton 设计了 Helmholtz machine,它的基本特性是通过生成自己的数据,并将其与实际数据比较,来实现无监督学习。它被称为生成模型(generative model),生成模型可以创造极其逼真的人脸图像(网站 thispersondoesnotexist.com)和文本(ChatGPT)

  16. 作为生成模型的新皮层不仅解释了幻觉,还解释了我们为什么会做梦

  17. 生成和识别是同一枚硬币的两面,两者不能同时进行,且会互相平衡。所以缺乏睡眠(生成)会产生幻觉

  18. 人类之所以拥有「通用」智能,是因为大脑中有许多处理各种事务的分区吗?恰恰相反,整个新皮层在处理能力上是没有区别的。新皮层能处理一切感官数据,接上视觉数据就能处理视觉,接上听觉数据就能处理听觉。把雪貂的耳朵的输入切断,并将视网膜输入连接至听觉皮层,而不是视觉皮层,发现雪貂仍然能看见。失明的人其它感官会更灵敏,也是因为腾出了更多新皮层处理其它感官信息。这种通用性是如何做到的?这至今仍然是个谜,不过看起来新皮层能对信息作出明确的、狭窄的假设

  19. 如何让 AI 表现出人类水平的智能?缺少哪些东西?一些人认为是语言和逻辑,但现在看起来不是,我们缺少的是更原始的东西,是更早进化的东西。Meta 的 AI 负责人 Yann LeCun 说:

    我们人类对语言和符号作为智能的基础给予了过多的重视。类人猿、狗、猫、乌鸦、鹦鹉、章鱼以及许多其他动物虽然没有人类那样的语言,却展现出超越我们最佳人工智能系统的智能行为。它们所拥有的是一种能力,能够学习强大的“世界模型”,使它们能够预测自己行为的后果,并寻找和规划行动以实现目标。今天的人工智能系统缺乏的正是学习这种世界模型的能力。

  20. 第四阶段智能突破:第一代灵长类动物的 mentalizing 能力。即推理他人意图的能力。比如黑猩猩会伪装走开,诱导其他黑猩猩翻出私藏的食物,然后回过去抢。这种能力的高级应用,就是玩政治的能力