跳到正文

#评测/基准

今日 0 条
10月2日周五
  1. 雷锋网70

    拆解 WorkBuddy、千问办公和豆包工作:同一份脏数据算出三个总额

    作者用同一份脏销售流水和同一句提示词实测 WorkBuddy、千问办公和豆包工作,三家都交付了 Excel、PPT 和摘要,但算出的季度总额最高比最低多出 57.7%。

    推荐理由:作者用同一份脏数据和同一句提示词实测三款办公 Agent,并拆开安装包对比执行环境,可看到三家在纠错方式与责任归属上的差异。

  2. 雷锋网47

    实测 GPT-6 Astra、Fable 5.1 与 GPT-5.6 Sol 控制同一台云台机器人

    作者把同一句模糊指令交给 GPT-6 Astra Pro、Claude Fable 5.1 和 GPT-5.6 Sol,三者都让两轴云台转了起来,但对完成的理解不同:Sol 和 Fable 走完四个组合极限角,Astra 只用 7 步分别抵达两轴边界。

    推荐理由:作者用同一台云台机器人实测三个模型,从动作数、速度参数和验证机制看它们对完成与风险的不同理解。

  3. 雷锋网58

    用三张圆明园鼠首照片实测:GPT-6 Astra 调度 Aholo Lux3D 与 Blender 生成 3D 资产

    作者用三张圆明园鼠首照片和一段自然语言指令,让 GPT-6 Astra 在 Codex 中调度 Aholo Lux3D 生成 3D 模型,再交由 Blender 检查、调材质、加底座并渲染导出。

    推荐理由:作者用三张鼠首照片跑通从自然语言到可交付 3D 资产的完整链路,并给出耗时与成本数据,可据此判断专业模型接入通用 Agent 的工程化路径。

9月30日周三
  1. 雷锋网49

    雷锋网实测:免费 AgnesCode 与 Codex 在 DeepSeek-V3 算子优化任务中互有胜负

    雷锋网把 AgnesCode + Agnes 3.0 Flash 与 Codex + GPT-5.6 Sol 放进众智 FlagOS 开放计算全球大赛的 DeepSeek-V3 解码阶段融合 QKV-A 下投影算子题(Task66: dsv3_fused_a_gemm),在 8 款芯片上接受赛事官方自动化评测。

    推荐理由:雷锋网用同一道算子优化题对比免费 AgnesCode 与付费 Codex,给出跨芯片加速比与耗时数据,可作 Agent 底层工程能力的参照。

8月6日周四
7月17日周五
5月29日周五
11月19日周三
9月5日周五
1月22日周三
11月21日周四