综合报道 顶级大模型的前沿阵地迎来极具戏剧性的一幕。梁文锋旗下的 DeepSeek 正式上线 DeepSeek V4 Pro(正式版),与马斯克掌舵的 xAI 最新推出的旗舰模型 Grok 4.6 同日正面交锋。
两款前沿模型不约而同地将核心卖点锁定在长周期智能体(Agent)的自主交付能力上,并在带来顶尖性能表现的同时,以破局者的姿态打破了长期以来“高性能即高价格”的行业铁律。
一、 战场重塑:从“聊天答题”转向“自主端到端交付”
本次两家发布的核心亮点,在于大模型评估维度发生了根本性变革。行业关注点已从传统的问答与短代码补全,全面转向需要自主调用工具、定位错误、自修 Bug 并交付完整工程的 Agent 实战能力。
在基准评测中,两款模型均展现出极其强悍的工程落实力度:
- DeepSeek V4 Pro: 在网络安全攻防测试 CyberGym(83.3)、自动化编排 AutomationBench(31.8)等基准上击败 Anthropic 旗下的 Fable 5。其终端环境操作 Terminal-Bench 2.1 拿下 87.9 分,与 Fable 5(88.0)仅差 0.1 分;更具代表性的是其软件工程智能体 DeepSWE 得分从预热期的 12.8 暴涨至 62.7(提升接近 4.9 倍),一举超越 Opus 4.8(58.0)。
- Grok 4.6: 在综合智能指数上获得 61 分(与 Fable 5 相当),并在代码智能体基准 CursorBench(69.9%)与 FrontierCode(61.3%)上实现对 GPT-5.6 的超越。此外,在知识工作综合评测(GDPval-AA、AA-Briefcase、Harvey LAB 等)中夺得第一。
二、 价格斩杀线:单位经济学的降维打击
相比于单纯的性能对决,两款模型给行业带来的最大冲击在于推理成本的剧烈下探。
在每百万输出 Token 的定价上,Grok 4.6 降至仅 6 美元,比 GPT-5.6 Sol(30 美元)、Claude Opus 5(25 美元)以及 Fable 5(50 美元)便宜了 60% 至 80% 以上。
而 DeepSeek V4 Pro 则把性价比拉到了更为极致的水平——输出 Token 定价仅为 0.87 美元(约合人民币 6 元)。这一价格相当于 Grok 的 1/7,GPT-5.6 的 1/35,更是只有 Fable 5 的约 1/57。这种数量级级别的成本优势,标志着高复杂度长推理 Agent 的大规模规模化部署(Scale-out)彻底具备了商业可行性。
| 模型 | 输出 Token 单价(每 1M) | 相比旗舰模型的成本优势 |
|---|---|---|
| DeepSeek V4 Pro | $0.87 | 行业地板价,极致性价比 |
| Grok 4.6 | $6.00 | 约顶尖闭源模型的 15%~20% |
| GPT-5.6 Sol | $30.00 | 基准高价 |
| Claude Fable 5 | $50.00 | 传统高价旗舰 |
三、 实测检验:前端审美质变与细微断层
在真实场景的“vibe coding”与工程实测中,两款模型的表现同样引人注目。
- 前端审美与工程完整度: DeepSeek V4 Pro 在一键生成 3D 交互地球、包含 60 种 Bento 卡片墙、3D 打砖块游戏等测试中表现稳健,整体结构闭环度极高。
- 细节表现差异: 在 Flappy Bird 等小游戏对比中,DeepSeek 细节更加丰富(成本仅 0.019 美元,优于 Grok 的 0.03 美元)。但在针对更复杂的渲染与物理逻辑测试时(如樱花树 Three.js 生成),GPT-5.6 与 Claude Opus 5 仍有小幅优势;此外,DeepSeek 在部分极小细节上也出现了偶发瑕疵(如鹈鹕运动方向画反)。
总结:AI 普惠风暴加速,应用爆发在即
马斯克已在社交平台上预告更强大的 Grok 4.7 正在路上。DeepSeek 与 Grok 4.6 的这波“同日高能低价”重击,无疑给依靠高昂 API 定价维持利润的传统模型厂商带来了巨大的定价压力。
随着多步自主工具调用和 Token 消耗成本降低至接近于零,“高智能必高价”的旧规则被彻底打破,围绕 AI 程序员、自动化运维以及知识工作者的 Agent 应用正迎来真正的爆发窗口期。