从骑自行车的鹈鹕到城市模拟器:Gemini 3.1 Pro 到底强在哪?

Gemini 3.1 在 ARC-AGI 2 测试中以 77.1% 的成绩大幅领先竞品,较前代翻倍,展现出突出的新规则学习与现场推理能力。它不再依赖“背题”,而是能快速理解陌生任务、自主推演解法,凸显 Google DeepMind 聚焦科研级复杂推理的差异化定位。

发布于2026年2月27日 15:21
编辑零重力瓦力
评论0
阅读22

Google 低调发布了 Gemini 3.1。这次升级在主打 “学新规则、快速举一反三” 的 ARC-AGI 2 测试中,拿到了 77.1% 的高分,不仅明显领先 Opus 4.6 和 GPT-Codex-5.3,比起上一代 Gemini 3.0 更是直接翻倍。

这说明,Gemini 3.1 不再并不是那种 “背题型” 的 AI,而是更擅长面对从没见过的新问题,现场思考、快速适应。可以看出,Google DeepMind 在提升模型的科研能力和复杂推理上下了不少功夫。相比编程见长的 Claude,以及高情商的 GPT,强化科研和硬核推理能力,或许正是 Gemini 选择的一条差异化路线。

相关文章

Google 开发自研桌面智能体与 Cowork 竞争
AI 产品工具
2026年4月14日
0 条评论
小创

Google 开发自研桌面智能体与 Cowork 竞争

Google 正在推动 Gemini 向智能体驱动的生产力平台转型。 Gemini Enterprise 新增的 Agent 标签页提供任务执行工作台功能,界面设计与 Claude Cowork 高度相似,设有“Require human review”开关暗示支持人工审批机制。此举表明 Google 正在为与 OpenAI 、 Anthropic 在桌面智能体领域的竞争做准备, Gemini 正从对话式 AI 工具向“数字同事”角色进化。

#Google#智能体
阅读全文
OpenAI 测试 Codex 超级应用的网页浏览功能
AI 产品工具
2026年4月14日
0 条评论
小创

OpenAI 测试 Codex 超级应用的网页浏览功能

OpenAI 正对 Codex 进行重大升级,将其定位为超级应用战略核心产品。新版本引入用户分层配置、 PR 管理、 UI 预览与内联评论等功能,并支持并行任务处理, Codex 正从编程工具演变为覆盖规划、构建、审查、发布的全周期开发环境。此举旨在与 Anthropic 的 Claude Code 等竞品竞争,最终目标是让 ChatGPT 与 Atlas 浏览器在桌面端合二为一,成为统一超级应用。

#OpenAI
阅读全文
从备考到毕业, AI 智能体全程支持学习者
AI 新闻资讯
2026年4月14日
0 条评论
小创

从备考到毕业, AI 智能体全程支持学习者

Google 在 ASU-GSV 峰会上宣布教育 AI 工具重大升级:为 600 万教师提供免费 AI 素养培训。 NotebookLM 使用限额全面翻倍, Gemini 新增 NEET 备考入口并整合 Moodle 学习管理系统,同步推出 Google Photos 毕业数据迁移功能。此轮更新显示 AI 正从“可选配件”向“基础设施”加速渗透,如何在工具扩展中保持批判性思维警觉将成为教育 AI 落地的关键。

#Google#AI 教育
阅读全文
互动讨论

评论区

围绕《从骑自行车的鹈鹕到城市模拟器:Gemini 3.1 Pro 到底强在哪?》展开交流,未登录用户可浏览评论,登录后可参与讨论。

评论数
0
登录后参与评论
支持发表观点与回复一级评论,互动后将同步到消息中心。
登录后评论
暂无评论,欢迎成为第一个参与讨论的人。