跳到正文

#评测/基准

今日 0 条
9月22日周二
9月21日周一
8月6日周四
8月5日周三
7月17日周五
7月9日周四
6月30日周二
6月23日周二
6月17日周三
6月16日周二
5月29日周五
2月26日周四
  1. OpenAI News39

    OpenAI 与太平洋西北国家实验室合作,推出 DraftNEPABench 加速联邦审批

    OpenAI 与太平洋西北国家实验室合作,推出 DraftNEPABench 基准,用于评估 AI 编码智能体如何加速联邦审批流程。该基准显示,NEPA 文件起草时间最多可减少 15%,并推动基础设施审查现代化。

    推荐理由:OpenAI 与联邦实验室联合发布基准,用 15% 的起草时间降幅说明 AI 编码智能体在政府审批场景的可用边界。

2月18日周三
12月16日周二
  1. OpenAI News38

    OpenAI 发布评测框架,用 GPT-5 优化湿实验室分子克隆流程

    OpenAI 推出一个真实场景评测框架,用于衡量 AI 加速湿实验室生物研究的能力。该工作使用 GPT-5 优化分子克隆实验方案,同时探讨 AI 辅助实验的潜力与风险。

    推荐理由:OpenAI 用真实湿实验场景评测 GPT-5 优化分子克隆流程的能力,为判断 AI 在生物实验中的可用边界提供参照。

12月11日周四
  1. OpenAI News55

    OpenAI 发布 GPT-5.2,刷新数学与科学基准成绩

    OpenAI 发布 GPT-5.2,称其是自家在数学与科学方面最强的模型,在 GPQA Diamond 和 FrontierMath 等基准上刷新了最优结果。官方表示这些提升已转化为实际研究进展,包括解决一个开放理论问题并生成可靠的数学证明。

    推荐理由:GPT-5.2 在 GPQA Diamond 与 FrontierMath 上刷新结果,并给出解决开放理论问题、生成可靠数学证明的实例。

11月19日周三
10月29日周三
  1. OpenAI News38

    OpenAI 发布 gpt-oss-safeguard 技术报告

    OpenAI 发布 gpt-oss-safeguard 技术报告,介绍 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 两个开源权重推理模型。这两个模型基于 gpt-oss 模型后训练,能够依据给定策略进行推理,从而按该策略对内容打标。报告描述了模型能力,并以底层 gpt-oss 模型为基线给出安全评测结果。

    推荐理由:OpenAI 公开 gpt-oss-safeguard 两个开源权重模型的技术报告,并给出以 gpt-oss 为基线的安全评测结果。

10月6日周一
  1. OpenAI News62

    OpenAI 发布 AgentKit、新版 Evals 与面向智能体的 RFT

    OpenAI 发布 AgentKit、扩展的 Evals 能力以及面向智能体的强化微调(RFT),用于帮助开发者更快从原型走向生产。官方称这三项工具面向智能体开发流程,但未在摘要中给出具体功能细节与可用范围。

    推荐理由:OpenAI 官方发布 AgentKit、扩展的 Evals 与面向智能体的强化微调,读者可据此判断智能体开发工具链的补齐方向。

9月25日周四
9月5日周五
7月30日周三
4月10日周四
2月18日周二
  1. OpenAI News40

    OpenAI 发布 SWE-Lancer 基准,测试前沿 LLM 能否赚到 100 万美元

    OpenAI 发布 SWE-Lancer 基准,用真实自由职业软件工程任务检验前沿 LLM 能否赚到 100 万美元。该基准以真实外包工作为评测对象,衡量模型在软件工程交付中的经济价值。

    推荐理由:OpenAI 用真实自由职业软件工程任务衡量前沿 LLM 的经济价值,可据此判断模型在真实交付场景中的能力边界。

1月23日周四
  1. OpenAI News38

    OpenAI 发布 Operator 系统卡

    OpenAI 发布 Operator 系统卡,基于其既有安全框架说明多层防护思路,包括为防范提示工程与越狱而实施的模型和产品层缓解措施,以及隐私与安全保护。文档还介绍了外部红队工作、安全评估,以及持续改进这些防护措施的后续工作。

    推荐理由:OpenAI 公开 Operator 的系统卡,说明其在提示工程与越狱防护、隐私安全上的多层缓解措施和外部红队评测安排。

1月22日周三
12月5日周四
  1. OpenAI News50

    OpenAI 发布 o1 与 o1-mini 系统卡

    OpenAI 发布 o1 与 o1-mini 的系统卡,说明模型发布前开展的安全工作,包括外部红队测试以及依据 Preparedness Framework 进行的前沿风险评测。

    推荐理由:系统卡披露了 o1 与 o1-mini 发布前的外部红队测试和前沿风险评测流程,可了解其安全评估框架。

12月4日周三
11月21日周四
9月12日周四
8月13日周二
7月17日周三
12月5日周一