OpenAI 提出有效第三方评估的优先事项与原则
OpenAI 提出针对前沿模型与防护措施的第三方 AI 安全评估的优先事项与原则,强调评估需严谨、安全且独立。
OpenAI 提出针对前沿模型与防护措施的第三方 AI 安全评估的优先事项与原则,强调评估需严谨、安全且独立。
OpenAI 提出为下一阶段 AI 建立共享全球标准的路径,呼吁通过协调一致的评估、报告与治理来提升安全性。
OpenAI Signals 数据显示,全球用户正把 ChatGPT 从提问工具变为做事工具,并给出国家级采用情况与使用趋势洞察。该数据覆盖各地采用程度、使用趋势与行为演变。
OpenAI 就近期涉及 OpenAI 模型的第三方网络安全评测事件作出说明,并概述了用于加强 AI 模型测试与评估的新保障措施。
推荐理由:OpenAI 就第三方网络安全评测中的事件作出说明,并给出新的模型测试与评估保障措施。
OpenAI 首席财务官 Sarah Friar 提出一套实用的 AI 记分卡,通过有用工作量、单次成功任务成本、可靠性和算力回报四项指标衡量 AI 的 ROI。
推荐理由:OpenAI 首席财务官提出用有用工作量、单次成功任务成本、可靠性和算力回报四项指标衡量 AI 投入产出。
OpenAI 公布了 GPT-5.5 Bio Bug Bounty 计划的详情。该计划围绕 GPT-5.5 的生物相关能力设立漏洞赏金机制,具体规则与参与方式随公告一并披露。
OpenAI 发布 GeneBench-Pro,一个用复杂真实数据集测试 AI 在基因组学、生物学和科研领域表现的新基准。
OpenAI 通过 Appia Foundation 支持先进 AI 的评估框架、安全实践与全球合作,推动构建共享标准。
OpenAI 发布 LifeSciBench,一个由专家撰写并评审的基准,用于评估 AI 系统处理真实生命科学研究任务与决策的能力。
OpenAI 推出 Deployment Simulation,一种在模型发布前用真实对话数据模拟部署、预测 AI 模型行为的方法,目标是提升安全性和评估准确性。
推荐理由:OpenAI 提出用真实对话数据在发布前模拟部署,读者可了解模型安全评估方法的一种新思路。
OpenAI 发布关于第三方 AI 评测的指导,内容涵盖如何评估前沿系统的模型能力、防护措施与评测有效性。
推荐理由:OpenAI 官方给出第三方评测的评估框架,涉及模型能力、防护措施与有效性,可供关注评测方法的人参考。
OpenAI 与太平洋西北国家实验室合作,推出 DraftNEPABench 基准,用于评估 AI 编码智能体如何加速联邦审批流程。该基准显示,NEPA 文件起草时间最多可减少 15%,并推动基础设施审查现代化。
推荐理由:OpenAI 与联邦实验室联合发布基准,用 15% 的起草时间降幅说明 AI 编码智能体在政府审批场景的可用边界。
OpenAI 与 Paradigm 联合推出 EVMbench,用于评测 AI 智能体检测、修补和利用高危智能合约漏洞的能力。该基准覆盖漏洞检测、补丁修复与漏洞利用三类任务。
推荐理由:OpenAI 与 Paradigm 联合推出智能体安全评测基准,关注 AI 在智能合约漏洞检测与修复上的能力边界。
OpenAI 推出一个真实场景评测框架,用于衡量 AI 加速湿实验室生物研究的能力。该工作使用 GPT-5 优化分子克隆实验方案,同时探讨 AI 辅助实验的潜力与风险。
推荐理由:OpenAI 用真实湿实验场景评测 GPT-5 优化分子克隆流程的能力,为判断 AI 在生物实验中的可用边界提供参照。
OpenAI 发布 GPT-5.2,称其是自家在数学与科学方面最强的模型,在 GPQA Diamond 和 FrontierMath 等基准上刷新了最优结果。官方表示这些提升已转化为实际研究进展,包括解决一个开放理论问题并生成可靠的数学证明。
推荐理由:GPT-5.2 在 GPQA Diamond 与 FrontierMath 上刷新结果,并给出解决开放理论问题、生成可靠数学证明的实例。
OpenAI 发文阐述 evals 如何帮助企业定义、衡量并改进 AI 性能,从而降低风险、提升生产力并形成战略优势。
OpenAI 发布 gpt-oss-safeguard 技术报告,介绍 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 两个开源权重推理模型。这两个模型基于 gpt-oss 模型后训练,能够依据给定策略进行推理,从而按该策略对内容打标。报告描述了模型能力,并以底层 gpt-oss 模型为基线给出安全评测结果。
推荐理由:OpenAI 公开 gpt-oss-safeguard 两个开源权重模型的技术报告,并给出以 gpt-oss 为基线的安全评测结果。
OpenAI 发布 AgentKit、扩展的 Evals 能力以及面向智能体的强化微调(RFT),用于帮助开发者更快从原型走向生产。官方称这三项工具面向智能体开发流程,但未在摘要中给出具体功能细节与可用范围。
推荐理由:OpenAI 官方发布 AgentKit、扩展的 Evals 与面向智能体的强化微调,读者可据此判断智能体开发工具链的补齐方向。
OpenAI 推出 GDPval,一项衡量模型在真实经济价值任务上表现的新评测,覆盖 44 个职业。
推荐理由:OpenAI 推出覆盖 44 个职业的 GDPval 评测,读者可据此了解模型在真实经济价值任务上的衡量方式。
OpenAI 发布新研究,解释语言模型产生幻觉的原因。研究结果显示,改进评测方式有助于提升 AI 的可靠性、诚实性与安全性。
推荐理由:OpenAI 从评测角度解释大模型幻觉的成因,读者可据此理解评测改进与模型可靠性之间的关系。
Intercom 分享了构建可扩展 AI 平台的三条经验,涵盖评估体系与架构设计,目标是引领客户支持的未来。
OpenAI 发布 BrowseComp,一个面向浏览智能体(browsing agents)的基准测试。
OpenAI 发布 SWE-Lancer 基准,用真实自由职业软件工程任务检验前沿 LLM 能否赚到 100 万美元。该基准以真实外包工作为评测对象,衡量模型在软件工程交付中的经济价值。
推荐理由:OpenAI 用真实自由职业软件工程任务衡量前沿 LLM 的经济价值,可据此判断模型在真实交付场景中的能力边界。
OpenAI 发布 Operator 系统卡,基于其既有安全框架说明多层防护思路,包括为防范提示工程与越狱而实施的模型和产品层缓解措施,以及隐私与安全保护。文档还介绍了外部红队工作、安全评估,以及持续改进这些防护措施的后续工作。
推荐理由:OpenAI 公开 Operator 的系统卡,说明其在提示工程与越狱防护、隐私安全上的多层缓解措施和外部红队评测安排。
OpenAI 提出以增加推理时计算来提升模型对抗鲁棒性的思路,即用更多推理算力换取对对抗攻击的抵抗能力。该方向探讨推理时计算与对抗鲁棒性之间的权衡关系。
OpenAI 发布 o1 与 o1-mini 的系统卡,说明模型发布前开展的安全工作,包括外部红队测试以及依据 Preparedness Framework 进行的前沿风险评测。
推荐理由:系统卡披露了 o1 与 o1-mini 发布前的外部红队测试和前沿风险评测流程,可了解其安全评估框架。
Morgan Stanley 正利用 AI 评估(AI evals)来塑造金融服务的未来。该行将 AI 评估应用于金融服务场景,以推动这一领域的未来发展。
OpenAI 发布文章阐述如何结合人类与 AI 推进红队测试。原文未披露具体模型版本、参数规模或 benchmark 数据,仅以标题点明人类与 AI 协同这一方向。
经济学家 Tyler Cowen 解读了 OpenAI o1 如何应对复杂经济问题。该内容聚焦 o1 在经济推理场景中的表现,由 OpenAI 发布。
OpenAI 发布 SWE-bench Verified,这是 SWE-bench 中经人工校验的子集,能更可靠地评估 AI 模型解决真实世界软件问题的能力。
推荐理由:OpenAI 发布经人工校验的 SWE-bench 子集,为评估模型解决真实软件问题的能力提供更可靠的基准。
OpenAI 提出证明者-验证者博弈(Prover-Verifier Games),用于提升语言模型输出的可读性,让 AI 给出的解答更清晰、更易被验证。该方法旨在使 AI 输出对人类和机器都更可信。
OpenAI 发布 Universe 软件平台,用于在游戏、网站及其他应用中衡量和训练 AI 的通用智能。该平台覆盖全球范围内的游戏、网站和其他应用资源。