拆解 WorkBuddy、千问办公和豆包工作:同一份脏数据算出三个总额
作者用同一份脏销售流水和同一句提示词实测 WorkBuddy、千问办公和豆包工作,三家都交付了 Excel、PPT 和摘要,但算出的季度总额最高比最低多出 57.7%。
推荐理由:作者用同一份脏数据和同一句提示词实测三款办公 Agent,并拆开安装包对比执行环境,可看到三家在纠错方式与责任归属上的差异。
作者用同一份脏销售流水和同一句提示词实测 WorkBuddy、千问办公和豆包工作,三家都交付了 Excel、PPT 和摘要,但算出的季度总额最高比最低多出 57.7%。
推荐理由:作者用同一份脏数据和同一句提示词实测三款办公 Agent,并拆开安装包对比执行环境,可看到三家在纠错方式与责任归属上的差异。
作者把同一句模糊指令交给 GPT-6 Astra Pro、Claude Fable 5.1 和 GPT-5.6 Sol,三者都让两轴云台转了起来,但对完成的理解不同:Sol 和 Fable 走完四个组合极限角,Astra 只用 7 步分别抵达两轴边界。
推荐理由:作者用同一台云台机器人实测三个模型,从动作数、速度参数和验证机制看它们对完成与风险的不同理解。
作者用三张圆明园鼠首照片和一段自然语言指令,让 GPT-6 Astra 在 Codex 中调度 Aholo Lux3D 生成 3D 模型,再交由 Blender 检查、调材质、加底座并渲染导出。
推荐理由:作者用三张鼠首照片跑通从自然语言到可交付 3D 资产的完整链路,并给出耗时与成本数据,可据此判断专业模型接入通用 Agent 的工程化路径。
OpenAI 研究员 Noam Brown 在播客访谈中表示,1 万个 Agent 耗时 88 小时、消耗 1300 亿 token 解出千禧年数学难题,但他认为多智能体最多只占其中 10% 的功劳,核心仍是模型本身足够强。
雷锋网把 AgnesCode + Agnes 3.0 Flash 与 Codex + GPT-5.6 Sol 放进众智 FlagOS 开放计算全球大赛的 DeepSeek-V3 解码阶段融合 QKV-A 下投影算子题(Task66: dsv3_fused_a_gemm),在 8 款芯片上接受赛事官方自动化评测。
推荐理由:雷锋网用同一道算子优化题对比免费 AgnesCode 与付费 Codex,给出跨芯片加速比与耗时数据,可作 Agent 底层工程能力的参照。
OpenAI Signals 数据显示,全球用户正把 ChatGPT 从提问工具变为做事工具,并给出国家级采用情况与使用趋势洞察。该数据覆盖各地采用程度、使用趋势与行为演变。
OpenAI 首席财务官 Sarah Friar 提出一套实用的 AI 记分卡,通过有用工作量、单次成功任务成本、可靠性和算力回报四项指标衡量 AI 的 ROI。
推荐理由:OpenAI 首席财务官提出用有用工作量、单次成功任务成本、可靠性和算力回报四项指标衡量 AI 投入产出。
OpenAI 发布关于第三方 AI 评测的指导,内容涵盖如何评估前沿系统的模型能力、防护措施与评测有效性。
推荐理由:OpenAI 官方给出第三方评测的评估框架,涉及模型能力、防护措施与有效性,可供关注评测方法的人参考。
OpenAI 发文阐述 evals 如何帮助企业定义、衡量并改进 AI 性能,从而降低风险、提升生产力并形成战略优势。
OpenAI 发布新研究,解释语言模型产生幻觉的原因。研究结果显示,改进评测方式有助于提升 AI 的可靠性、诚实性与安全性。
推荐理由:OpenAI 从评测角度解释大模型幻觉的成因,读者可据此理解评测改进与模型可靠性之间的关系。
OpenAI 提出以增加推理时计算来提升模型对抗鲁棒性的思路,即用更多推理算力换取对对抗攻击的抵抗能力。该方向探讨推理时计算与对抗鲁棒性之间的权衡关系。
OpenAI 发布文章阐述如何结合人类与 AI 推进红队测试。原文未披露具体模型版本、参数规模或 benchmark 数据,仅以标题点明人类与 AI 协同这一方向。