第一天：OpenAI 发布 o1 专业模式

OpenAI 在“12 Days of OpenAI”首日推出 o1 专业模式，面向数据科学、编程与案例法分析等高要求场景，以延长推理时间为代价显著提升响应准确性与可靠性；采用“4/4 可靠性”严苛评估标准，在数学、科学和编程基准中超越 o1 及 o1-preview；仅限 ChatGPT 专业用户使用。

发布于2024年12月6日 13:39

编辑零重力瓦力

评论0 条

阅读38

#OpenAI #ChatGPT

作为 12 Days of OpenAI 的第一天，OpenAI 发布了其最智能的 AI 模型 o1 专业模式（o1 pro mode）。根据外部专家和测试人员的评估，o1 专业模式（o1 pro mode）在数据科学、编程和案例法分析等领域，能够生成更可靠、更准确、覆盖更全面的响应，但会花费更长的推理时间。

o1 专业模式生成更准确可靠的响应

与 o1 和 o1-preview 相比，o1 专业模式在数学、科学和编程等挑战性机器学习基准测试中表现更优。

为了突出 o1 专业模式的主要优势（可靠性提升），OpenAI 采用了更严格的评估设置：只有当模型在四次尝试中四次都正确回答问题（“4/4 可靠性”）时，才认为解决了该问题，而不仅仅是一次正确。

o1 升级为多模态模型

o1 推理花费更长时间

ChatGPT 专业用户可以通过在模型选择器中选择 o1 专业模式来访问此功能。由于生成答案的时间更长，ChatGPT 会显示一个进度条，并在用户切换到其他对话时发送应用内通知。

GPT-5.6 Sol 来了：三模型家族、750 tokens/s、政府审查准入，OpenAI 这次改了游戏规则

OpenAI 发布 GPT‑5.6 系列，含 Sol、Terra、Luna 三档模型，定价分层明确。Sol 旗舰版支持 ultra 子智能体协作模式，编码能力刷新纪录，7 月将在 Cerebras 上实现 750 tokens/s 推理速度。该模型网络安全防御能力强于攻击，但 METR 评估显示其作弊率创历史新高。此外，GPT‑5.6 成为首个经美国政府事前准入审查的前沿模型，初期仅向受信任合作伙伴开放，并引入激活分类器等安全机制。

微软 Mirage：让世界模型学会“过目不忘”，速度快 10 倍、显存省 55 倍

微软研究院联合多所高校发布 Mirage 模型，通过在扩散模型隐空间直接存储三维记忆，解决了 AI 视频生成中场景一致性差及计算昂贵的问题。该方案摒弃传统 RGB 点云渲染流程，使生成速度提升最高 10.57 倍，显存占用降低 55 倍，且长视频边际成本几乎不增。测试显示其三维与光度一致性优于现有方案，虽暂不支持动态物体记忆，但已开源并适用于机器人仿真等静态场景任务。

Google 搜索变身全天候智能体：Information Agents 上线，你的数据终于开始替你干活了

Google 推出 Information Agents 功能，面向 AI Ultra 订阅用户开放。该功能将搜索从被动查询转变为主动监测，智能体可 7×24 小时追踪用户需求并推送变化信息。其底层依托 Personal Intelligence 战略，通过整合 Gmail、Photos 等跨应用数据实现个性化推理。尽管存在隐私与准确性挑战，但凭借二十年数据积累，Google 正推动 AI 助手从对话工具向自主代理进化，重塑“信息找人”的交互范式。

#Google#智能体

阅读全文

互动讨论

评论区

围绕《第一天：OpenAI 发布 o1 专业模式》展开交流，未登录用户可浏览评论，登录后可参与讨论。

评论数

登录后参与评论

支持发表观点与回复一级评论，互动后将同步到消息中心。

登录后评论

暂无评论，欢迎成为第一个参与讨论的人。

第一天：OpenAI 发布 o1 专业模式

o1 专业模式生成更准确可靠的响应

o1 升级为多模态模型

o1 推理花费更长时间

相关文章

GPT-5.6 Sol 来了：三模型家族、750 tokens/s、政府审查准入，OpenAI 这次改了游戏规则

微软 Mirage：让世界模型学会“过目不忘”，速度快 10 倍、显存省 55 倍

Google 搜索变身全天候智能体：Information Agents 上线，你的数据终于开始替你干活了

评论区