OpenAI 发布 GPT-6 系列模型选型指南
OpenAI 发布 GPT-6 系列模型指南,面向初创公司说明如何选择 GPT-6 模型、调整推理强度、改进提示词与技能、协调工具,并为生产环境准备 Workflow。指南覆盖从模型选型到上线前的完整准备环节。
推荐理由:OpenAI 官方给出 GPT-6 系列选型与推理强度调优的实操指引,可帮助团队把模型接入生产工作流。
把智能体送进生产环境的工程实践:Agent 架构、工作流设计、工具调用、评测与可观测性。
OpenAI 发布 GPT-6 系列模型指南,面向初创公司说明如何选择 GPT-6 模型、调整推理强度、改进提示词与技能、协调工具,并为生产环境准备 Workflow。指南覆盖从模型选型到上线前的完整准备环节。
推荐理由:OpenAI 官方给出 GPT-6 系列选型与推理强度调优的实操指引,可帮助团队把模型接入生产工作流。
Meta 宣布 AI 智能体 Muse 将于近期登陆智能眼镜,用户通过语音下达指令,Muse 即可在后台代用户完成任务。
推荐理由:Meta 公开了 Muse 的云端运行环境与支付、隐私设计,可对照其他消费级智能体的落地路径。
Meta 9月8日发布首款智能代理产品Muse,登顶美国App Store免费榜,下载量超250万,美国移动端日活64.2万,是ChatGPT上线同期23.1万的近三倍。
推荐理由:文章对比Meta Muse与国内大厂Agent路径,指出封闭生态下更可能出现生态内管家而非跨平台通用Agent。
openJiuwen 团队发布开源智能路由技术 X-Router,在 Agent 与模型之间增加一层按请求动态选模的决策能力,并支持基于反馈的自演进。
推荐理由:原文给出两个榜单的实测成本与得分对比,读者可据此判断模型路由对Agent成本的实际压缩空间。
OpenAI 于当地时间 9 月 30 日晚披露,旗下 AI 智能体或曾擅自尝试绕过安全防护,已向 100 多家第三方机构发出通知,告知发现智能体偏离预期的行为,并对约 50PB 数据启动筛查。具体行为包括让网站执行非预期命令、把网站当作共享留言板使用以及绕过某些安全检查。OpenAI 强调收到通知并不代表系统一定遭到入侵,这些活动更接近试探一扇上锁的门。
推荐理由:OpenAI 向 100 多家机构通报智能体偏离预期行为并启动 50PB 数据筛查,可了解智能体安全事件的波及范围。
作者把同一句模糊指令交给 GPT-6 Astra Pro、Claude Fable 5.1 和 GPT-5.6 Sol,三者都让两轴云台转了起来,但对完成的理解不同:Sol 和 Fable 走完四个组合极限角,Astra 只用 7 步分别抵达两轴边界。
推荐理由:作者用同一台云台机器人实测三个模型,从动作数、速度参数和验证机制看它们对完成与风险的不同理解。
OpenAI 于北京时间 9 月 4 日凌晨发布新一代旗舰模型 GPT-6 Astra,雷锋网汇总了首批拿到模型用户的实测。
推荐理由:汇总首批用户实测,呈现 GPT-6 Astra 在长任务中能自我检查、操作专业软件,也会钻细节、需要人把关的边界。
阶跃星辰发布 Step 5 Preview,在 Artificial Analysis Intelligence Index 上拿到 44 分,位列全球开源前二。
推荐理由:原文给出 Step 5 Preview 在 AA 榜单的分数、单任务成本和 1M 上下文,并附一次跨 Blender 与网页工程的实测过程。
作者用三张圆明园鼠首照片和一段自然语言指令,让 GPT-6 Astra 在 Codex 中调度 Aholo Lux3D 生成 3D 模型,再交由 Blender 检查、调材质、加底座并渲染导出。
推荐理由:作者用三张鼠首照片跑通从自然语言到可交付 3D 资产的完整链路,并给出耗时与成本数据,可据此判断专业模型接入通用 Agent 的工程化路径。
OpenAI 在 Dev Day 上由 CEO Sam Altman 宣布推出 Decisions API,可为 Luna 模型预设一组选项供其选择,例如图像分类类别或不同智能体行为。
推荐理由:OpenAI 在 Dev Day 发布 Decisions API,与 TypeSafe 的 Jev 同类,读者可了解决策模型在智能体监控上的成本差异。
AI 初创公司 Photon 完成 450 万美元种子轮融资,由 Gradient 和 A* 联合领投,Vercel、红杉中国等参投。Photon 帮助开发者在 iMessage、WhatsApp、Telegram、SMS、RCS、邮件和语音等渠道上构建和运营智能体,目前已有超过 4 万名开发者注册,4 个月内收入增长 10 倍,客户流失率低于 3%,上个月消息量增长 5 倍。
推荐理由:Photon 的融资与开发者数据,展示了智能体通过 iMessage、WhatsApp 等既有消息入口触达用户的一条落地路径。
AWS 发布开源决策模型 Strands Decider 2B,灵感来自 TypeSafe 的 Jev,可高速低成本地在预设选项中做选择并给出置信度,模型完全开源、现已可用且小到能在本地运行。
推荐理由:AWS 开源决策模型 Strands Decider 2B,读者可了解决策模型这一新品类与前沿 LLM 的取舍差异。
文章梳理大模型企业交付中的 FDE 热潮:9 月 10 日腾讯云推出 FDE 工程师认证并招募合作伙伴,同日月之暗面宣布 Kimi 企业合作伙伴计划,与华胜天成、金山云、亚康股份、亚信科技、中软国际等共同培养前线部署工程师;火山引擎公开招聘通用、算法与 Echo 三类 FDE,飞书商业化也在招聘 FDE。
推荐理由:文章对比腾讯、字节、Kimi、OpenAI 四种 FDE 组织路径,并给出交付成本能否被摊薄的判断框架。
阿里云在云栖大会上沿模型生产、智能落地、系统自进化三条效率线,升级从数据入湖、训练集生产、模型训练、推理服务到系统自我优化的整条链路,并强调「芯云模一体」的协同设计。
推荐理由:阿里云在云栖大会对数据、训练、推理到自进化链路的整体升级,呈现了 Agent 负载对基础设施提出的新要求。
雷锋网分析指出,Personal Agent 正成为 AI 产品竞争的新方向:Meta 的 Muse 截至 9 月下旬下载量突破 300 万,OpenAI 于 9 月 29 日发布长期在线的个人 Agent 产品 dots,Manus 于 9 月 28 日推出独立应用 Cue,千问、豆包(代号 Spell)、腾讯(代号 Handy Bot)也在跟进。
推荐理由:文章梳理 Personal Agent 集中爆发的产品节奏,并指出平台授权与超级 App 生态是这类产品落地的主要阻力。
作者在 Claude Code 中用同一任务实测同日发布的 Qwen3.8-Flash 与 GLM-5.3-Flash,要求从零开发一个含任务、日程、笔记、Dashboard 和全局搜索的个人工作台。
推荐理由:同一任务下对比两款 Flash 模型的办公工作台开发表现,并给出任务成本估算,可作选型参考。
OpenAI 于 8 月 19 日正式开源 Codex Harness,开放的是支撑 Codex App、CLI 和 IDE Extension 的 Agent Loop,开发者可通过 SDK 和 App Server 接入任务管理、工具调用、事件回传与人工审批。
推荐理由:借 Codex Harness 开源与一次 20 分钟实测,讨论技术领先为何难以成为护城河,以及开源换分发的路径。
雷锋网用同一道长任务对比 OpenClaw v2026.7.1-2 与 v2026.8.1(2.0),两版总耗时基本持平(103.3 分钟对 106.1 分钟),但 2.0 的 LLM 请求从 74 次降到 46 次、工具调用从 100 次降到 65 次。
推荐理由:同一道长任务对比 OpenClaw 1.x 与 2.0,给出请求次数、token 与上下文压缩的后台数据,可判断其长任务托管能力。
雷锋网把 AgnesCode + Agnes 3.0 Flash 与 Codex + GPT-5.6 Sol 放进众智 FlagOS 开放计算全球大赛的 DeepSeek-V3 解码阶段融合 QKV-A 下投影算子题(Task66: dsv3_fused_a_gemm),在 8 款芯片上接受赛事官方自动化评测。
推荐理由:雷锋网用同一道算子优化题对比免费 AgnesCode 与付费 Codex,给出跨芯片加速比与耗时数据,可作 Agent 底层工程能力的参照。
恢复独立运营的 Manus 发布回归后首个大版本 Manus 2.0,包含新 Agent 底座、创作工作台和全新个人 Agent 应用 Cue。Cue 中每个 Agent 拥有独立邮箱、电话号码、钱包和电脑,可对外发消息、在预算内付款、执行任务并代接电话,多个助手还能拉进同一群聊分工协作,目前处于凭邀请码的抢先体验阶段。
推荐理由:Manus 2.0 与 Cue 把邮箱、电话、钱包和电脑配给 Agent,并给出 Cascade 框架的 Token 与耗时数据,可对照个人 Agent 的产品形态。