跳到正文

#评测/基准

今日 0 条
10月2日周五
  1. 钛媒体62

    谷歌 DeepMind 发布 Gemini 4 首款旗舰模型 Argon

    谷歌 DeepMind 于 9 月 30 日正式发布 Gemini 4 系列首款旗舰模型 Argon,官方称在 19 项基准测试中取得 13 项领先,输出 Token 上限从上一代的 6.4 万提升到 100 万。

    推荐理由:文章把 Argon 的基准成绩、真实工程案例与内部质疑放在一起,读者可据此判断跑分领先与实际落地之间的落差。

  2. 雷锋网70

    拆解 WorkBuddy、千问办公和豆包工作:同一份脏数据算出三个总额

    作者用同一份脏销售流水和同一句提示词实测 WorkBuddy、千问办公和豆包工作,三家都交付了 Excel、PPT 和摘要,但算出的季度总额最高比最低多出 57.7%。

    推荐理由:作者用同一份脏数据和同一句提示词实测三款办公 Agent,并拆开安装包对比执行环境,可看到三家在纠错方式与责任归属上的差异。

  3. 雷锋网47

    实测 GPT-6 Astra、Fable 5.1 与 GPT-5.6 Sol 控制同一台云台机器人

    作者把同一句模糊指令交给 GPT-6 Astra Pro、Claude Fable 5.1 和 GPT-5.6 Sol,三者都让两轴云台转了起来,但对完成的理解不同:Sol 和 Fable 走完四个组合极限角,Astra 只用 7 步分别抵达两轴边界。

    推荐理由:作者用同一台云台机器人实测三个模型,从动作数、速度参数和验证机制看它们对完成与风险的不同理解。

  4. 雷锋网58

    用三张圆明园鼠首照片实测:GPT-6 Astra 调度 Aholo Lux3D 与 Blender 生成 3D 资产

    作者用三张圆明园鼠首照片和一段自然语言指令,让 GPT-6 Astra 在 Codex 中调度 Aholo Lux3D 生成 3D 模型,再交由 Blender 检查、调材质、加底座并渲染导出。

    推荐理由:作者用三张鼠首照片跑通从自然语言到可交付 3D 资产的完整链路,并给出耗时与成本数据,可据此判断专业模型接入通用 Agent 的工程化路径。

10月1日周四
  1. 钛媒体62

    谷歌发布 Gemini 4 Argon:18 项基准拿下 12 项第一,终端操作仍落后

    谷歌推出新一代旗舰模型 Gemini 4 Argon,采用公司迄今规模最大的预训练,在谷歌公布的 18 项基准测试中拿下 12 项第一、1 项并列第一,GPT-6 Astra 为 3 项第一、1 项并列第一,Claude Opus 5.5 为 2 项第一。

    推荐理由:原文列出 Gemini 4 Argon 在 18 项基准中的胜负分布与短板项,可据此判断它在知识工作与终端操作上的能力边界。

9月30日周三
  1. 雷锋网62

    OpenClaw 2.0 实测:Agent 网关能重塑工作流边界吗

    雷锋网用同一道长任务对比 OpenClaw v2026.7.1-2 与 v2026.8.1(2.0),两版总耗时基本持平(103.3 分钟对 106.1 分钟),但 2.0 的 LLM 请求从 74 次降到 46 次、工具调用从 100 次降到 65 次。

    推荐理由:同一道长任务对比 OpenClaw 1.x 与 2.0,给出请求次数、token 与上下文压缩的后台数据,可判断其长任务托管能力。

  2. 雷锋网49

    雷锋网实测:免费 AgnesCode 与 Codex 在 DeepSeek-V3 算子优化任务中互有胜负

    雷锋网把 AgnesCode + Agnes 3.0 Flash 与 Codex + GPT-5.6 Sol 放进众智 FlagOS 开放计算全球大赛的 DeepSeek-V3 解码阶段融合 QKV-A 下投影算子题(Task66: dsv3_fused_a_gemm),在 8 款芯片上接受赛事官方自动化评测。

    推荐理由:雷锋网用同一道算子优化题对比免费 AgnesCode 与付费 Codex,给出跨芯片加速比与耗时数据,可作 Agent 底层工程能力的参照。

9月22日周二
9月21日周一
8月6日周四
8月5日周三
7月17日周五
7月9日周四
6月30日周二
6月23日周二
6月17日周三
6月16日周二
5月29日周五
2月26日周四
  1. OpenAI News39

    OpenAI 与太平洋西北国家实验室合作,推出 DraftNEPABench 加速联邦审批

    OpenAI 与太平洋西北国家实验室合作,推出 DraftNEPABench 基准,用于评估 AI 编码智能体如何加速联邦审批流程。该基准显示,NEPA 文件起草时间最多可减少 15%,并推动基础设施审查现代化。

    推荐理由:OpenAI 与联邦实验室联合发布基准,用 15% 的起草时间降幅说明 AI 编码智能体在政府审批场景的可用边界。

2月18日周三
12月16日周二
  1. OpenAI News38

    OpenAI 发布评测框架,用 GPT-5 优化湿实验室分子克隆流程

    OpenAI 推出一个真实场景评测框架,用于衡量 AI 加速湿实验室生物研究的能力。该工作使用 GPT-5 优化分子克隆实验方案,同时探讨 AI 辅助实验的潜力与风险。

    推荐理由:OpenAI 用真实湿实验场景评测 GPT-5 优化分子克隆流程的能力,为判断 AI 在生物实验中的可用边界提供参照。

12月11日周四
  1. OpenAI News55

    OpenAI 发布 GPT-5.2,刷新数学与科学基准成绩

    OpenAI 发布 GPT-5.2,称其是自家在数学与科学方面最强的模型,在 GPQA Diamond 和 FrontierMath 等基准上刷新了最优结果。官方表示这些提升已转化为实际研究进展,包括解决一个开放理论问题并生成可靠的数学证明。

    推荐理由:GPT-5.2 在 GPQA Diamond 与 FrontierMath 上刷新结果,并给出解决开放理论问题、生成可靠数学证明的实例。

11月19日周三
10月29日周三
  1. OpenAI News38

    OpenAI 发布 gpt-oss-safeguard 技术报告

    OpenAI 发布 gpt-oss-safeguard 技术报告,介绍 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 两个开源权重推理模型。这两个模型基于 gpt-oss 模型后训练,能够依据给定策略进行推理,从而按该策略对内容打标。报告描述了模型能力,并以底层 gpt-oss 模型为基线给出安全评测结果。

    推荐理由:OpenAI 公开 gpt-oss-safeguard 两个开源权重模型的技术报告,并给出以 gpt-oss 为基线的安全评测结果。

10月6日周一
  1. OpenAI News62

    OpenAI 发布 AgentKit、新版 Evals 与面向智能体的 RFT

    OpenAI 发布 AgentKit、扩展的 Evals 能力以及面向智能体的强化微调(RFT),用于帮助开发者更快从原型走向生产。官方称这三项工具面向智能体开发流程,但未在摘要中给出具体功能细节与可用范围。

    推荐理由:OpenAI 官方发布 AgentKit、扩展的 Evals 与面向智能体的强化微调,读者可据此判断智能体开发工具链的补齐方向。

9月25日周四
9月5日周五
7月30日周三
4月10日周四
2月18日周二
  1. OpenAI News40

    OpenAI 发布 SWE-Lancer 基准,测试前沿 LLM 能否赚到 100 万美元

    OpenAI 发布 SWE-Lancer 基准,用真实自由职业软件工程任务检验前沿 LLM 能否赚到 100 万美元。该基准以真实外包工作为评测对象,衡量模型在软件工程交付中的经济价值。

    推荐理由:OpenAI 用真实自由职业软件工程任务衡量前沿 LLM 的经济价值,可据此判断模型在真实交付场景中的能力边界。

1月23日周四
  1. OpenAI News38

    OpenAI 发布 Operator 系统卡

    OpenAI 发布 Operator 系统卡,基于其既有安全框架说明多层防护思路,包括为防范提示工程与越狱而实施的模型和产品层缓解措施,以及隐私与安全保护。文档还介绍了外部红队工作、安全评估,以及持续改进这些防护措施的后续工作。

    推荐理由:OpenAI 公开 Operator 的系统卡,说明其在提示工程与越狱防护、隐私安全上的多层缓解措施和外部红队评测安排。

1月22日周三
12月5日周四
  1. OpenAI News50

    OpenAI 发布 o1 与 o1-mini 系统卡

    OpenAI 发布 o1 与 o1-mini 的系统卡,说明模型发布前开展的安全工作,包括外部红队测试以及依据 Preparedness Framework 进行的前沿风险评测。

    推荐理由:系统卡披露了 o1 与 o1-mini 发布前的外部红队测试和前沿风险评测流程,可了解其安全评估框架。

12月4日周三
11月21日周四
9月12日周四