分享
0403-AI 正在构建 AI — Google DeepMind
输入“/”快速插入内容
0403-AI 正在构建 AI — Google DeepMind
用户9970
用户9970
用户3733
用户3733
5月9日修改
AI 正在构建 AI — Google DeepMind 的 Mostafa Dehghani
> MAD Podcast | Matt Turck × Mostafa Dehghani | 2026-04-02
youtube 地址:
https://www.youtube.com/watch?v=Bo19sXssYXI
> 嘉宾:Mostafa Dehghani,Google DeepMind 资深研究员,Universal Transformers、Vision Transformer(ViT)、Gemini 多模态家族的核心贡献者
---
核心观点
1. AI 构建 AI 已经在发生,不是科幻,而是现实
Dehghani 明确表示:过去几个月里,几乎每个顶级实验室的新一代模型都大量依赖上一代模型来构建。这不是"用 AI 工具辅助开发",而是 AI 在自动更新自身权重、递归式地改进自己。目前还差的是"长周期全自动化",但方向非常清晰,进展速度超出预期。
2. 自我改进是深度学习革命的延续
从手工设计特征 → 深度学习自动学习表征 → 自动学习架构 → 数据驱动训练 → 自我改进循环——每一步都在消除人类瓶颈和偏见。自我改进不是突然的革命,而是同一个故事的最新章节。
3. 评估(Evaluation)是最大的瓶颈,本质上是哲学问题
"你只能改进你能衡量的东西。"目前缺少能够衡量自我改进进度的评估体系。Dehghani 指出,即使是一个超级能干的团队,如果没有具体的评估指标,也很难取得进展。构建评估体系的难度不亚于构建模型本身。
4. 模型坍塌风险存在但可控
关键在于保持"接地"(grounded):只要有强验证器或真实奖励信号作为锚点,就可以避免模型在封闭循环中坍塌。完全封闭的循环(模型只与自己交互)才是坍塌的高风险场景。
5. 持续学习被严重低估,将颠覆现有的 RAG 体系
当前的基础模型本质上是"冻结在时间里的"——训练结束后,所有 RAG 管线、微调流程、检索系统都建立在这个"模型不变"的假设上。Dehghani 认为这个假设太强了,持续学习一旦突破,现有的企业数据管线将被彻底重构。
6. 技术进步不是万能药——治理和社会信任是更大的挑战
Dehghani 警告:一个在技术上极其聪明但在其他方面存在盲区的 AI 版本,不可能创造有意义的现实进步。治理、监管、社会信任、技术红利的公平分配、制度吸收能力——这些问题的难度不亚于技术本身,而技术进步的速度正在远离世界解决这些问题的能力。
7. 长周期自动化的可靠性问题是当前最大工程挑战
如果一个 agent 每步的成功率是 95%(已经很高),执行 100 步连续任务的整体成功率只有 0.95^100 ≈ 0.6%。这个数学是残酷的。用户不会体验到模型的"平均表现",他们只记住失败——一次愚蠢的错误对信任的损害远超 100 次正确操作带来的好处。
---
精彩片段
关于 Loops 的两个层次:
"循环在两个层面运作。微观层面是推理时的测试时计算——chain of thought、负稀疏性(negative sparsity,即复用模型参数多次)都是例子。宏观层面是模型开发循环本身的自我改进。"
关于 Karpathy 的 Auto Research 项目:
"这绝对是递归自我改进的早期例证。之前我们只看到 AI 在工程环节做得好,但在研究环节——那个需要直觉和 gut feeling 的环节——现在也看到了信号。那个成功配方中'黄金部分'——来自优秀研究者的直觉——正在被模型学到。"
关于形式化验证的局限性:
"形式化验证是开启自我改进最有力的钥匙之一,但不是唯一钥匙。对数学和代码逻辑来说很好——证明要么通过要么不通过。但你没法写一个形式化证明来验证医生的建议好不好。真正的挑战是:如何将这种紧密、诚实的反馈循环扩展到'混乱'的现实世界领域。"
关于 Vision Transformer 的诞生故事:
"我 2017 年在 Google Brain 实习, recruiters 说有个团队刚发了篇论文叫 Transformer,在找实习生。我跟 Łukasz 聊完,给他发消息说不想去——'谁还在做 Transformer 这种随机架构,大家都用 LSTM,这东西会死的。'结果没找到其他团队,只好去了。这改变了我的一生。"
"做 ViT 的时候,我们从非常复杂的角度开始想,试图模拟卷积操作。最后成功的方案反而是最简单的——把图片切成 16×16 的 patch,喂给 transformer,放大规模,搞定。"
关于原生多模态的价值——正迁移:
"语言存在'报道偏见'(reporting bias):你不会描述一把普通的沙发,但会描述一个香蕉形状的沙发。所以通过文本学习世界知识效率很低。视觉输入没有这个问题——信息就在那里。让模型生成图像不只是增加能力,更是让它更高效地理解世界——这就是正迁移。"
关于 Nano Banana 的增量生成:
"传统图像生成器一次性要画 50 个细节,容易遗漏。但如果是交错生成(文本→图像→文本→图像),模型可以先画大物体(因为小物体容易放不下),再画中物体,最后补小物体。模型在做规划——把每一步的难度匹配到自己的能力范围。你永远不会被单次生成的极限所束缚。"
关于给女儿的职业建议:
"我女儿一岁半。过去几年我多次预测错误——觉得 6 个月能搞定的事没搞定,觉得 10 年不可能的事 3 个月就解决了。如果她问我该学什么专业,我没有好答案。但我知道几项关键能力:战略思维、在决策时掌握全局参数、而不是成为某个极窄领域的绝对专家。"