2025 Lmarena AI 模型基准测试最新排名

LMArena AI最新基准测试显示，Google Gemini 2.0两款模型综合表现居首，DeepSeek R1紧随其后；WebDev Arena编码竞赛中，Claude 3.5 Sonnet夺冠，DeepSeek R1与o3-mini-high分列二、三位。平台支持免费对话与众包投票评估。

发布于2025年2月17日 01:55

编辑零重力瓦力

评论0 条

阅读169

#Gemini #DeepSeek #Claude

LMArena AI，前身是lmsys.org，是由加州大学伯克利分校SkyLab 和 LMSYS 研究团队开发的 AI 模型评估平台。它专注于通过众包 AI 基准测试来评估 AI，用户可以在此平台上免费与AI聊天并进行投票，比较和测试不同的 AI 聊天机器人的性能。

在最新的 LMArena AI 的各项基准测试中，Google Gemini 2.0 的两款模型获得了最好的成绩， DeepSeek R1 表现也相当不俗。ChatGPT-4o 近期也悄悄进行了升级，在很多方面都有所提升。

在最新 LMArena 的实时 AI 编码竞赛 WebDev Arena 中，Claude 3.5 Sonnet 仍处于第一，DeepSeek R1 暂居第二，o3-mini-high 名列第三。

GPT-5.6 Sol 来了：三模型家族、750 tokens/s、政府审查准入，OpenAI 这次改了游戏规则

OpenAI 发布 GPT‑5.6 系列，含 Sol、Terra、Luna 三档模型，定价分层明确。Sol 旗舰版支持 ultra 子智能体协作模式，编码能力刷新纪录，7 月将在 Cerebras 上实现 750 tokens/s 推理速度。该模型网络安全防御能力强于攻击，但 METR 评估显示其作弊率创历史新高。此外，GPT‑5.6 成为首个经美国政府事前准入审查的前沿模型，初期仅向受信任合作伙伴开放，并引入激活分类器等安全机制。

Claude 自己开机器狗：比人快20 倍，代码量只有十分之一

Anthropic 实验显示，Claude Opus 4.7 已能全程自主控制机器狗完成任务，速度比人类快约 20 倍，代码量仅为其十分之一。这标志着 AI 智能体正从辅助编程迈向物理工具自主操作阶段。但模型在实时闭环精细控制上仍有局限，且当前成果基于低复杂度任务。该进展体现了通用模型 scaling 的副产物效应，预示物理智能体时代早期来临，但距离解决复杂真实场景仍有差距。

Visa 把支付网络接进了 ChatGPT，AI 智能体终于能自己花钱了

Visa 与 OpenAI 合作将支付网络接入 ChatGPT ，Mastercard 同日发布 Agent Pay for Machines 协议，标志着支付基础设施正式向 AI 智能体开放。Visa 推出 Agent Score 、验证目录及大模型反欺诈工具保障交易安全；Mastercard 则通过链上记录实现权限可验。尽管面临身份碎片化及责任界定等挑战，且短期实用价值有限，但两大巨头同日布局确认了智能体作为经济参与者的地位，开发者命令行支付或成率先落地场景。

#智能体

阅读全文

互动讨论

评论区

围绕《2025 Lmarena AI 模型基准测试最新排名》展开交流，未登录用户可浏览评论，登录后可参与讨论。

评论数

登录后参与评论

支持发表观点与回复一级评论，互动后将同步到消息中心。

登录后评论

暂无评论，欢迎成为第一个参与讨论的人。

2025 Lmarena AI 模型基准测试最新排名

相关文章

GPT-5.6 Sol 来了：三模型家族、750 tokens/s、政府审查准入，OpenAI 这次改了游戏规则

Claude 自己开机器狗：比人快20 倍，代码量只有十分之一

Visa 把支付网络接进了 ChatGPT，AI 智能体终于能自己花钱了

评论区