在 atomic_chat 桌面应用中,Grok 4.5 免费版在机器人对战、液压机压碎和卡车跳峡谷三个浏览器物理演示中达到 GPT-5.6 Sol 水平。测试要求模型生成自包含 HTML5 Canvas 代码,处理重力、碰撞检测和帧控制。输出对比:GPT-5.6 Sol 12.9K tokens/$0.51(约7分钟),Grok 4.5 10.8K tokens/免费(约5分钟),Muse Spark 1.1 26.8K tokens/$0.12(约7.5分钟),GLM 5.2 10.9K tokens/$0.02(约12分钟)。物理演示暴露了普通编码基准隐藏的弱点:模型可能用更多 token 描述丰富场景,却难以维持跨帧的力、动量、碰撞时序和可信物体行为。Grok 4.5 目前仅通过 Grok Build 和 Cursor 免费使用。
Grok 4.5 reached GPT-5.6 Sol level across 3 browser physics demos for free.
Prompts were for robot combat, hydraulic pressing, and a canyon-jumping truck.
Test was done on atomic chat (@atomic_chat_hq), a desktop app that runs LLMs locally.