DeepMind成立新研究院,四篇文章直面AGI关键问题

9月18日,谷歌旗下DeepMind正式宣布成立DeepMind研究院(DeepMind Institute),由DeepMind联合创始人、首席AGI科学家Shane Legg担任常务主编,谷歌高级副总裁James Manyika、DeepMind董事长Demis Hassabis共同出任董事。该机构旨在为谷歌、DeepMind及全球学术研究社群搭建围绕通用人工智能(AGI)社会影响的开放探讨平台,官方公告明确表示将呈现多元观点,且各方观点未必始终统一,在瞬息万变的前沿领域,随着更多数据与信息浮出水面,相关看法也很可能发生转变。

DeepMind成立新研究院,四篇文章直面AGI关键问题

四篇首发文章瞄准AGI四大核心议题

研究院首批发布的四篇文章覆盖AGI治理的多项关键方向,分别为应对通用人工智能潜在冲击的经济政策设计、保留人类可读懂的模型推理过程的可行路径、人类繁荣发展的基本原则,以及前沿AI模型评估框架搭建。其中多篇文章由DeepMind核心研究人员执笔,直指当前AGI发展的核心争议点,具体包括:

  • 应对AGI潜在冲击的经济政策方案
  • 人类可监控模型推理的路径研究
  • 人类繁荣发展的AGI适配原则
  • 前沿AI模型的标准化评估框架

模型推理透明度下降成AGI安全核心关切

由DeepMind安全研究员Rohin Shah与Anca Dragan共同撰写的文章指出,当前AI模型的“可透明度”——即人类查看、核验模型一步步推理过程的能力持续弱化,并非不可逆转的必然结果。两人强调,新架构让最强AI模型的监控难度不断提升,开发者与监管机构需要直面其中的安全权衡。
针对这一问题,文章给出了两类可行解决方向:一是限制“不透明串行深度”,即约束模型在不输出可读推理轨迹的前提下能够执行的顺序计算量;二是要求开发者证明,透明度更低的系统依然具备可监控性。文章同时提到,激烈的行业竞争正在让AI公司越来越不愿公开模型相关信息,部分厂商发布模型时的信息透明度持续下降,进一步加剧了安全风险。

哈萨比斯提议建美国主导的前沿AI评估机构

DeepMind CEO Demis Hassabis在首发文章中对前沿AI的监管框架提出了具体设想,提议建立由美国主导的前沿AI标准机构,专门评估最先进的人工智能模型。
按照其设计的框架,该机构运行初期将采用自愿提交模式,模型开发者可在发布前最多提前30天接受审查。待评估体系验证有效后,在美国部署前沿AI模型或将强制要求通过该机构的测试。该机构初期会与各家AI企业磋商设计评估方案,后续将开发独立、不对外公开的“隔离测试集(held-out tests)”,避免实验室针对已知测试标准刻意调优模型。Hassabis同时提到,如果风险形势达到严峻程度,这套框架可以逐步收紧,甚至推动前沿AI开发者实施协同放缓研发节奏。

行业AGI治理从模糊担忧走向具体规则落地

DeepMind研究院文集发布之际,全球AI行业的治理讨论正从泛泛的安全担忧,转向围绕信息披露、外部独立审查,以及防护措施跟不上风险时采取协同减速的具体方案。本周,多位行业巨头公开表态支持Anthropic首席执行官达里奥·阿莫代提出的对前沿AI发展进行“节奏管控”的主张,进一步加速了这一转变。
此外,Shane Legg也公开回应了近期“AGI已经到来”的行业热议,指出OpenAI总裁Greg Brockman、英伟达CEO黄仁勋此前将OpenAI新模型Astra与AGI到来关联的说法并不准确,Astra虽然能力较强,但并未达到OpenAI自身对AGI的定义——即高度自主,并在大多数有经济价值的工作上超过人类。值得注意的是,Anthropic已于今年3月成立类似的研究机构Anthropic Institute,将红队测试、社会影响和经济研究团队整合到一起,共同推进AGI相关研究。