本页由志愿者 Celeste Li (李琬瑜) 翻译。由于译者水平及理解可能存在偏差,译文中的部分措辞或表述未必完全准确,如有疏漏,敬请谅解。 不清楚时,请参阅英文原文
关于 METR
模型评估与威胁研究

我们的目标

METR 的目标是建立科学方法,用于评估 AI 系统自主能力所带来的灾难性风险,并帮助人们就 AI 系统的开发作出明智决策。

未来某个时候,AI 系统很可能有能力完成人类能做的大多数事情,包括开发新技术、创办企业并获取收入、发现新的网络安全漏洞利用方法及修复办法,等等。这可能迅速而深刻地改变世界,既可能带来巨大的益处,也可能造成巨大的危害。遗憾的是,我们很难准确预测这一切会在何时、以何种方式发生。如果能够衡量 AI 系统的自主能力,企业和政策制定者就能判断这些系统何时可能产生极其广泛的影响,并将工作重点放在这些影响重大的情形上。

潜在后果可能极为重大:先进 AI 系统追求与人类意愿相悖的目标,看来完全有可能。这可能是有人蓄意制造混乱的结果,也可能在人们本意只是开发安全的 AI 系统时发生。1此外,考虑到事态可能发展得极快,我们认为,仅仅等待并观察情况是否开始严重失控,是不够的。我们需要能够判断一个 AI 系统是否存在引发全球性灾难的显著风险。

我们认为,世界需要一个独立的第三方,以科学、实证的方法研究 AI 系统的能力与风险。我们也重视透明与开放:在条件允许的情况下,我们公开所有研究成果和风险评估,并努力向更广泛的公众传达我们的观点。

利益冲突政策

确保我们对企业的评估准确、公正,是我们的首要任务。我们致力于尽可能缓解利益冲突,并在相关评估报告中披露任何未能缓解的利益冲突。完整的利益冲突政策请见此处

合作关系

我们曾与 OpenAIAnthropicGoogle DeepMindMetaAmazon 合作,试行前沿风险评估。这些公司也向我们提供了模型访问权限和 token 使用额度,用于评估、研究和工程工作。

我们也是 NIST AI 安全研究所联盟(NIST AI Safety Institute Consortium)加州网络安全工作组(California Cybersecurity Task Force)的成员,并与 AI 安全研究所(AI Security Institute)开展合作,同时向欧洲 AI 办公室(European AI Office)提供技术援助。

资金来源

METR 的经费来自捐赠。我们感谢众多支持者以各种方式提供的支持:通过 The Audacious Project(设于 TED 的一项资助计划)获得的首笔机构级规模资助;来自 Jane Street 的个人捐赠;Sijbrandij Foundation、The Pew Charitable Trusts、Schmidt Sciences、Packard Foundation、LaCentra-Sumerlin Foundation、Astralis Foundation 和 Expa.org 等基金会的资助;AI 安全研究所的支持;Longview Philanthropy 和 Effektiv Spenden 等机构的联合资助基金;Survival and Flourishing Fund 的资助推荐;以及 David Farhi、Geoff Ralston、Dylan Field、Steve Newman 等众多其他支持者的帮助。

也欢迎您加入他们的行列,支持 METR。(注:METR 无法接受前沿 AI 公司员工本人捐赠或由其指示作出的捐赠。)

此外,我们有一小部分收入来自与欧洲 AI 办公室签订的技术援助合同,用于支持其评估失控风险的整体方法和技术手段。METR 从未接受 AI 公司的资金资助。不过,如前所述,我们确实使用了大量免费 token 额度,用于评估、研究和工程工作。独立的资金来源至关重要:它使我们能够追求最有前景的研究方向,并为基于证据理解 AI 风险确立标准。这也是我们尽可能确保研究准确的方式之一。

Leadership

Technical Staff

Ajeya Cotra
Ajeya Cotra
Technical Staff
Bruce Lee
Bruce Lee
Technical Staff
David Rein
David Rein
Technical Staff
Dmitrii Calzago
Dmitrii Calzago
Technical Staff
Jonathan Gabor
Jonathan Gabor
Technical Staff
Josh Engels
Josh Engels
Technical Staff
Lena Hickson Long
Lena Hickson Long
Technical Staff
Lev McKinney
Lev McKinney
Technical Staff
Lucas Sato
Lucas Sato
Technical Staff
Manish Shetty
Manish Shetty
Technical Staff
Matt Putz
Matt Putz
Technical Staff
Megan Kinniment
Megan Kinniment
Technical Staff
Neev Parikh
Neev Parikh
Technical Staff
Nikola Jurkovic
Nikola Jurkovic
Technical Staff
Paarth Shah
Paarth Shah
Technical Staff
Parker Whitfill
Parker Whitfill
Technical Staff
Pip Arnott
Pip Arnott
Technical Staff
Rafael Carvalho
Rafael Carvalho
Technical Staff
Reilly Haskins
Reilly Haskins
Technical Staff
Rif A. Saurous
Rif A. Saurous
Technical Staff
Spruce Bondera
Spruce Bondera
Technical Staff
Thomas Broadley
Thomas Broadley
Technical Staff
Tim Hua
Tim Hua
Technical Staff
Tom Cunningham
Tom Cunningham
Technical Staff
Khalid Mahamud
Khalid Mahamud
Research Contractor

Operations Staff

Bhaskar Chaturvedi
Bhaskar Chaturvedi
Operations Staff
Jingyi Wang
Jingyi Wang
Operations Staff
Kris Chari
Kris Chari
Operations Staff
Parv Mahajan
Parv Mahajan
Operations Staff
Rae She
Rae She
Operations Staff
Stephanie Palla
Stephanie Palla
Director of Operations
Wilder Seitz
Wilder Seitz
Operations Staff

Policy Staff

Kit Harris
Kit Harris
Policy Staff
Rox Heston
Rox Heston
Policy Staff

Advisors

Adam Gleave
Adam Gleave
Advisor and Board Member
Rajiv Dattani
Rajiv Dattani
Advisor and Board Member

Research Collaborators

Specialist Partners

装饰图片

  1. AI 系统可能出现目标导向行为,而以表面化的方式尝试对齐机器学习系统,可能导致迎合或欺骗行为,而非成功实现对齐。