OpenAI 发布 o1 模型及多项开发者工具更新
OpenAI 发布 o1 模型,同时带来 Realtime API 改进、一种新的微调方法以及面向开发者的其他更新。官方未在摘要中给出各项更新的具体参数与上线细节。
推荐理由:OpenAI 官方一次性公布 o1 模型与面向开发者的多项工具更新,可据此了解其开发者侧能力布局。
OpenAI 发布 o1 模型,同时带来 Realtime API 改进、一种新的微调方法以及面向开发者的其他更新。官方未在摘要中给出各项更新的具体参数与上线细节。
推荐理由:OpenAI 官方一次性公布 o1 模型与面向开发者的多项工具更新,可据此了解其开发者侧能力布局。
OpenAI 发布 o1 与 o1-mini 的系统卡,说明模型发布前开展的安全工作,包括外部红队测试以及依据 Preparedness Framework 进行的前沿风险评测。
推荐理由:系统卡披露了 o1 与 o1-mini 发布前的外部红队测试和前沿风险评测流程,可了解其安全评估框架。
OpenAI 发布 o1 模型,官方页面标题为 Introducing OpenAI o1。该材料抓取失败,除标题外无正文内容可供进一步说明。
OpenAI 发布 o1-mini,官方定位为在推理能力上追求成本效率的模型。该条目来自 OpenAI 官方新闻源,正文仅给出“Advancing cost-efficient reasoning”这一说明,未披露参数、价格或基准数据。
OpenAI 发布 o1 模型贡献说明,原文仅提供标题,未给出具体贡献者名单或技术细节。
经济学家 Tyler Cowen 解读了 OpenAI o1 如何应对复杂经济问题。该内容聚焦 o1 在经济推理场景中的表现,由 OpenAI 发布。
Cognition CEO 兼联合创始人 Scott Wu 说明 OpenAI o1 如何以更接近人类的方式做出编码决策。
推荐理由:Cognition CEO 说明 OpenAI o1 在编码决策上更接近人类思路,可据此判断该模型在编码场景的定位。
OpenAI 宣布 GPT-4o 现已支持微调,开发者可基于该模型进行定制化训练。
OpenAI 发布 SWE-bench Verified,这是 SWE-bench 中经人工校验的子集,能更可靠地评估 AI 模型解决真实世界软件问题的能力。
推荐理由:OpenAI 发布经人工校验的 SWE-bench 子集,为评估模型解决真实软件问题的能力提供更可靠的基准。
OpenAI 发布 GPT-4o 系统卡,用于说明该模型在安全评估与风险方面的相关情况。原文正文抓取失败,仅标题可用。
OpenAI 发布 GPT-4o mini,官方定位为更具成本效率的智能模型。
OpenAI 提出证明者-验证者博弈(Prover-Verifier Games),用于提升语言模型输出的可读性,让 AI 给出的解答更清晰、更易被验证。该方法旨在使 AI 输出对人类和机器都更可信。
OpenAI 进一步说明其文本转语音模型 Voice Engine 的技术原理与安全研究。该模型可根据文本生成语音,官方同时公布了相关的安全研究内容。
OpenAI 宣布推出新旗舰模型 GPT-4 Omni(GPT-4o),可实时跨音频、视觉和文本进行推理。
推荐理由:OpenAI 官方发布新旗舰模型 GPT-4o,可实时跨音频、视觉和文本推理,读者可据此了解其多模态能力定位。
OpenAI 发布最新旗舰模型 GPT-4o,同时让 ChatGPT 免费用户获得更多能力。官方称此次既上线新旗舰模型,也扩大了免费用户可用的工具范围。
推荐理由:OpenAI 发布新旗舰模型 GPT-4o,并首次把更多能力开放给 ChatGPT 免费用户。
OpenAI 在春季更新中推出 GPT-4o,并让 ChatGPT 免费用户可用更多能力。原文未披露 GPT-4o 的具体参数、版本号与免费能力清单。
推荐理由:OpenAI 在春季更新中推出 GPT-4o,并让 ChatGPT 免费用户获得更多能力,可据此判断免费版能力边界的变化。
OpenAI 公开了 Voice Engine 的小规模预览经验,这是一个用于创建自定义语音的模型。OpenAI 表示正在分享这次预览中获得的经验与教训。
推荐理由:OpenAI 首次公开语音克隆模型 Voice Engine 的小规模预览,并分享其中的经验与风险考量。
OpenAI 发布新的嵌入模型,并同步更新 API。
OpenAI 在 DevDay 上发布 GPT-4 Turbo,支持 128K 上下文且价格更低,并推出 GPT-4 Turbo with Vision。同时公布新的 Assistants API 和 DALL·E 3 API 等开发者产品。
推荐理由:OpenAI 在 DevDay 一次性公布 GPT-4 Turbo、Assistants API 等模型与开发者产品,可据此了解其当时的能力与定价方向。
OpenAI 发布 DALL·E 3 系统卡,介绍该图像生成模型在安全方面的评估与应对措施。
OpenAI 发布 GPT-4V(ision) 系统卡,介绍该视觉模型的能力与安全评估情况。原文正文未能抓取,仅标题可用。
OpenAI 宣布开发者现在可以用自己的数据微调 GPT-3.5 Turbo,以适配各自的使用场景,同时更新了 API。原文未披露微调价格、可用范围等具体细节。
推荐理由:OpenAI 开放 GPT-3.5 Turbo 微调,开发者可用自有数据定制模型,是当时落地定制能力的关键变化。
OpenAI 发布 GPT-4,称其为扩展深度学习规模的最新里程碑。GPT-4 是接受图像和文本输入、输出文本的大型多模态模型,在多个专业和学术基准上达到人类水平表现,但在许多真实场景中能力仍不及人类。
推荐理由:OpenAI 官方给出 GPT-4 的多模态输入输出形态与基准表现,可作为判断该模型能力边界的原始依据。
OpenAI 发布 GPT-4,可在创意与技术写作任务中与用户生成、编辑和迭代内容,例如创作歌曲、撰写剧本,或学习用户的写作风格。
OpenAI 发布 Point-E,一个可根据复杂提示生成 3D 点云的系统。
OpenAI 发布新版嵌入模型,能力显著提升、成本更低且更易使用。官方称该模型在性能、价格和易用性上均有改进,但未披露具体参数规模、benchmark 分数或定价细节。
OpenAI 发布对话式模型 ChatGPT,以对话形式与用户交互。官方称该对话格式让 ChatGPT 能回答追问、承认自身错误、质疑错误前提并拒绝不当请求。
推荐理由:OpenAI 官方发布对话式模型 ChatGPT,说明其能追问、认错、质疑错误前提并拒绝不当请求。
OpenAI 推出改进版 Codex,这是其将自然语言转换为代码的 AI 系统,从今天起通过 API 以私测形式发布。
推荐理由:OpenAI 官方公布 Codex 改进版并开放 API 私测,读者可据此了解自然语言转代码能力的开放节奏。
OpenAI 表示,已有超过 300 个应用通过其 API 提供由 GPT-3 驱动的搜索、对话、文本补全等 AI 功能。
OpenAI 发布了一个 API,用于访问 OpenAI 开发的新 AI 模型。
推荐理由:OpenAI 官方宣布开放 API 以调用其新开发的 AI 模型,是了解其模型对外提供方式的早期节点。