
METR - 前沿AI能力评估研究机构,自主任务测试、风险评估与安全政策工具
METR 简介
METR(Model Evaluation and Threat Research)是一家位于美国加州伯克利的非营利研究机构,前身为ARC Evals,于2023年拆分独立。METR以“人类的准备团队”为自我定位,核心使命是开发科学方法评估AI系统自主能力可能引发的灾难性风险,帮助企业与政策制定者做出更好的开发决策。机构通过设计长时任务评估套件,测量AI模型在无人干预下能自主完成多长时间的工作,其研究成果已成为前沿AI实验室部署决策的重要参考。
METR 核心功能/服务
前沿AI自主能力评估:METR开发了包含77项任务的核心评估套件,测量AI智能体在真实软件工程、机器学习研究与网络安全等场景下自主完成长时任务的能力,测试模型在无人监督下能工作多长时间。
时间跨度研究与趋势跟踪:METR提出的“时间跨度”指标显示,AI模型能可靠完成的任务时长每7个月翻倍,近期已加速至约4个月。该趋势图被业界视为衡量AI自主能力进展的核心参考指标。
AI安全政策与治理研究:METR开创了“负责任扩展政策”(RSP)框架,该框架已被9家AI开发商采用。机构还发布前沿AI安全政策汇总分析、可监测性评估与MALT行为数据集,为AI治理提供实证基础。
METR 适合谁
- AI安全研究与政策制定者:需要了解前沿AI自主能力现状与风险的科学研究者与政策制定者,可参考METR的评估报告、趋势数据与安全政策分析。
- 前沿AI开发团队与部署决策者:负责AI模型部署决策的技术团队,可利用METR的预部署评估结果与风险分级框架,判断模型是否已具备需加强防护的能力阈值。
- 关注AI治理的企业与机构:需要建立AI风险管理体系的企业,可借鉴METR的RSP框架与安全政策共同要素分析,完善自身的AI治理流程。
为什么选择METR
METR作为独立第三方评估机构,已与OpenAI、Anthropic、Google DeepMind、Meta和Amazon合作开展前沿风险预部署评估。机构不接受AI公司的资金支持,仅接受模型访问权限与token额度用于研究,保障评估的独立性。其时间跨度研究成果被广泛引用,RSP框架已成为AI行业安全治理的参考标准之一。METR同时是NIST AI安全研究所联盟成员及加州网络安全工作组成员。**访问METR官网**,查阅最新评估报告与安全政策研究。
数据统计
关于(METR)特别声明
本站商娱网提供的METR都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由商娱网实际控制,在2026-09-25 10:57收录和巡查时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,商娱网不承担任何责任。
相关导航


联合国环境署

美国华盛顿大屠杀纪念馆
美国白宫
![日本参议院[日]](https://fav.3520.net/www.sangiin.go.jp.png)
日本参议院[日]
![国际电信组织[协]](https://fav.3520.net/www.itu.int.png)
国际电信组织[协]
![加拿大首相府[加拿大]](https://fav.3520.net/pm.gc.ca.png)
加拿大首相府[加拿大]
![西班牙皇家[西]](https://fav.3520.net/www.casareal.es.png)


