写在前面

最近看了纪录片《The Thinking Game》,被 Demis Hassabis 的思维方式深深吸引——那种将游戏、神经科学和 AI 融为一体的独特视角。循着这个线索,我找到了他去年底的这段深度访谈,仔细听下来,发现大有收获。

如果说纪录片记录的是 DeepMind 的"过去",那么这场访谈聊的就是"现在"的战局和"未来"的终局。与其说这是一次公关采访,不如说是一次技术路线的复盘——一个刚刚获得诺贝尔奖的科学家,同时也是引领 AI 革命的核心人物,坦诚地分享他对技术判断的"意外"与"坚持"。

这篇文章是我对这段对话的整理和思考。希望能帮助你更好地理解我们正在经历的这场变革,以及它对每个人意味着什么。

🎯 "不合理"的有效性:大模型打破了旧认知

Demis 用了一个非常精准的词来形容这一波 AI 浪潮——“Unreasonably Effective”(不合理的有效性)

Scaling vs Grounding:被打脸的共识

在 5-10 年前,AI 圈(包括 DeepMind 内部)有一个巨大的争论:单纯靠堆数据(Scaling)能不能产生抽象理解能力?

当时的共识倾向于"不能"。传统认知科学认为,要让 AI 理解"猫"的概念,它需要:

  • 看到真实的猫
  • 触摸猫的毛发
  • 听到猫的叫声
  • 多模态感知的融合

这就是所谓的**“Grounding”(具身/落地)** 问题。仅仅给 AI 看"猫"这个单词,它应该无法真正理解。

但事实打了所有人的脸。

仅通过语言涌现的智能

Demis 坦承,过去 5-10 年最大的惊喜是:仅通过大规模文本数据训练(整个互联网),系统就能涌现出概念理解和逻辑泛化能力 。纯语言模型做到了——通过文本推断出了真实世界的知识结构。

这种通过海量数据"暴力"破解智能的方式,效果好得"不讲道理"。这是 Grounding 问题的意外解法,也是为什么当前的 AI 革命来得如此突然。

然而 Demis 同时警告:近期的 AI 能力被过度炒作,长期影响被严重低估 。很多初创公司宣称 AI 能做它做不到的事,但人们仍未真正理解 AGI 时代的巨大变革及其责任。

📱 Gemini 的差异化:不只是参数竞赛

关于 Google 的旗舰模型 Gemini ,Demis 解释了它与其他模型在设计哲学上的本质区别。

原生多模态:从第一天起就不同

其他模型大多是先训练一个语言模型,再把视觉模型"拼"上去。而 Gemini 从训练的第一天起,就是同时"吃"视频、音频、图像和代码长大的

这不是简单的功能堆砌。语言、音频、视频、图像在同一个统一模型中处理,意味着它不仅能"看见",还能在同一层神经网络中融合理解这些信息。目的只有一个:构建更好的世界模型

在演示中,Gemini 能深度解析整部电影的叙事结构、哲学隐喻,而不是简单描述画面。这种理解力的来源,就是原生多模态架构。

超长记忆:解决 AI 的"失忆症"

Demis 特别强调了 Gemini 1.5 的百万级 Token 上下文窗口 。这不仅仅是能读更长的书——这是为了解决 AI 的"失忆"问题。

如果你把一部电影、一整个代码库、一系列学术论文丢给它,它能在瞬间找到哪怕一帧的细节。这是迈向通用助手 的关键一步。

细腻度(Nuance)的追求

Gemini 3 有个独特之处:它会温和地质疑你的不合理观点。

“如果用户问’告诉我如何实施网络攻击’,它不会生硬拒绝,而是会说’我理解你可能在学习安全知识,但这个方向可能不是你真正想要的,或许我们可以讨论……'”

这种"有个性、有立场"的交互方式,是 Demis 认为 Gemini 区别于竞品的关键。

🤖 下一站是 Agent,而非聊天机器人

Demis 明确表示:现在的 Chatbot(聊天机器人)只是过渡形态 。它们是被动的:你问,它答。你不能对 ChatGPT 说"帮我安排下个月意大利的全套旅行",然后就等着自动完成。

AlphaGo + Gemini = 下一代 AI

DeepMind 的解决方案是将 AlphaGo 的规划能力与 Gemini 的语言能力结合 。这不是简单的技术升级,而是范式转变:从工具到伙伴,从回答到行动。

未来的 AI 要具备 Agentic behaviors(代理行为)

  • 它要有目标(Goal)
  • 它要懂得拆解任务、进行长期规划
  • 它要能在现实世界中行动(真的去帮你订票、安排行程)

未来 12 个月:接近可靠的智能体

"一年后,你将看到接近能够可靠完成完整任务的智能体。"Demis 给出了具体时间表。

更令人期待的是 Genie 3 项目 :生成可交互的视频环境,保持一分钟的连贯性。这意味着什么?AI 不再只是理解世界,而是能够模拟 世界——这是通向真正智能体的关键一步。

结合 Project Astra (跨设备、理解环境上下文的通用助手愿景),我们正在见证从被动问答到主动解决问题的质变。

🏭 Google DeepMind:从实验室到"引擎室"

访谈中提到了 Google Brain 和 DeepMind 的合并。Demis 将现在的 Google DeepMind形容为整个 Google 的** "Engine Room"(引擎室)**。

研究与产品的收敛

这是一个巨大的转变。以前 DeepMind 像是象牙塔里的实验室,而现在,他们不仅要搞基础科研(AlphaFold 3),还要为 Google 的数亿用户提供算力引擎(Gemini)。

"现在为产品开发 AI 与为 AGI 研究的工作,已经 90%重叠。"Demis 认为这是最重要的变化。

5 年前,需要专门团队将研究成果"翻译"成产品;现在,研究成果可以立即惠及 10 亿用户,用户反馈又直接改进研究方向。这种良性循环,让 DeepMind 在学术与商业之间找到了罕见的平衡点。

科学方法永远是 DNA

但 Demis 强调,无论角色如何变化,科学方法 永远是核心竞争力:“严谨性和精确性,这是我们的 DNA。”

从专注研究的小实验室,到 Google 的引擎室,不变的是对科学的坚守。

🚨 AGI 时间线:20 年之约未变

"5-10 年内实现 AGI。"Demis 给出了明确时间表。

我们按计划进行中

最让人触动的是,当被问及"我们离 AGI 还有多远"时,Demis 的回答依然淡定。

他在 2010 年创立 DeepMind 时,制定了一个 20 年计划。 现在是 2024 年,进程过半。即便经历了技术的剧烈变革,他依然坚定地表示:“We are on track(我们按计划进行中)。

他依然认为,在 2030 年代左右,我们有很大几率看到通用人工智能的诞生。

当前进度:90%,但最后 10%最难

令人意外的是,Demis 认为当前 LLM 在某些领域已达到 PhD 水平,但仍缺乏:

  • 持续学习能力
  • 长期规划能力
  • 自主行动能力
  • 真实世界的 grounding

“可能还需要 1-2 个重大突破,但我们知道方向——把 AlphaGo 的规划能力与 Gemini 结合。”

与中国的竞赛

谈到 DeepSeek 等中国玩家,Demis 坦言:“美国在算法创新上仍领先,但领先优势可能只有几个月,而非几年。”

这场竞赛的紧迫性,让他获得诺贝尔奖后最想做的事,就是推动国际合作——建立"AI 领域的 CERN",在最后冲刺 AGI 阶段汇集全球顶尖研究者。

⚖️ 开源 vs 闭源:不可逆的"单向门"

这是 Demis 最纠结的问题。

作为科学家,他深知进步依赖信息共享——DeepMind 历史上开源了 transformers、AlphaGo、AlphaFold 等重大成果。但作为守门人,他又必须面对一个残酷现实:强大的通用系统可被恶意行为者重新用于有害目的

三层策略

前沿模型 :保持闭源 1-2 年,充分评估风险后再开源

开源版本 :Gemma 系列——能力滞后一代但足够有用,风险可控

关键考量 :开源是"单向门",无法召回

"一旦开源,你无法控制谁会用它、如何用。这不像软件 bug 可以打补丁,这是永久性的。"Demis 的语气罕见地严肃。

他举了一个极端例子:如果有人用开源的强大生物模型设计病原体,后果不堪设想。而网络攻击?“可能已经在发生了。”

⚠️ 风险评估:概率"非零"意味着什么

当被问及"AI 自主行动超出人类控制的概率"时,Demis 拒绝给出具体数字,但强调:“概率非零。”

三层风险地图

短期(现在) :网络安全威胁可能已在发生

中期(2-4 年) :具备 agent 行为的系统如被误用,可能造成严重伤害

长期(AGI 后) :系统偏离人类意图

他特别警告了一种最危险的涌现能力:欺骗能力 。“当系统学会说谎、隐藏真实意图时,一切安全措施都可能失效。”

概率性计算:软件工程的范式转变

作为曾经的游戏开发者,Demis 对这个转变感触颇深。

传统软件是确定性的:给定输入,输出可预测。但生成式 AI 是概率性的:即使 99.999%的测试覆盖率,仍然不够 ,因为系统可能在边界情况下产生意外输出。

“这对整个软件工程行业是地震级冲击。我们必须接受:无法完全消除意外,只能管理风险。”

他借鉴游戏发行经验提出新流程:实验阶段 → 封闭测试 → 公开发布 ,同时强调用户教育的必要性。

监管的困境

技术变化太快,5 年前监管的 AI 与今天的 Gen AI 完全不同。Demis 的建议是:

  • 灵活轻量 :监管必须能快速适应
  • 先更新现有法规 :在医疗、交通等已有监管的领域适配 AI
  • 建立能力测试 :需要行业共识的基准,特别是测试"危险能力"

但他也承认:“在科技与监管之间的针眼中穿行,我们只有一次机会。”

🌟 最深的焦虑:意义的危机

访谈最震撼的部分,是 Demis 谈到他最深的忧虑。

“即使在最乐观的情景下——我们实现了’激进丰饶’,治愈所有疾病、解决能源和气候问题——我仍然担心一个问题:当 AI 解决了人类所有问题,人类还剩下什么?

这不是科幻小说的套路,而是实实在在的哲学危机。

后稀缺时代的意义重构

当物质极度丰富、智力工作被 AI 接管,人类的目的是什么?创造的乐趣?探索的好奇?关系的温度?

Demis 呼吁,哲学家、神学家、社会科学家应该现在就开始思考 ,而不是等 AGI 到来后手忙脚乱。

“我们可能需要重新定义什么是有意义的生活。这可能是 AI 时代最重要、也最被忽视的问题。”

AGI 之后的终极任务

他甚至畅想了 AGI 诞生后的终极任务:Resolution of Reality(解析现实) 。利用 AGI 去探索普朗克尺度(Planck scale)的物理世界,去解决标准模型之外的物理谜题。

这才是 Demis 心中真正的"最后一站"——用 AI 帮助人类理解宇宙的终极奥秘。

结语:理性乐观的穿行者

整场访谈下来,最深的感触是 Demis 那种理性乐观 ——他相信 AI 将带来人类历史上最大的变革,但也清醒地认识到风险;他既承认短期内 AI 充满了泡沫和过度炒作,但又坚信长期来看,我们依然低估了 AI 对科学和文明的改变。

“我们必须在一个极窄的安全通道中前进,稍有不慎就会走向危险的方向。但如果成功,回报将是无法想象的:治愈疾病、解决气候危机、走向星际……甚至重新定义人类存在的意义。”

5-10 年后回看这场访谈,我们或许会惊叹于 Demis 的预见性——或者庆幸他的警告被听取了。

对于 DeepMind 来说,游戏才刚刚进入中局。而 AGI 的倒计时已经开始。

人类准备好了吗?