博主Alex Ziskind近日公布一组本地AI推理对比数据:搭载RTX 5090移动版(24GB 显存)的雷蛇灵刃18,与拥有128GB统一内存的苹果M5 Max同台测试。
在12B至35B规模的中小模型下,RTX 5090优势明显。Gemma 4 12B模型中RTX 5090跑出4110 tokens/sec,相较M5 Max的1762tokens/sec领先约133%;Qwen3.5 27B领先109%,即便到35B级的Qwen3.6 35B A3B,RTX 5090仍有32% 的提示处理优势。
一旦进入超大模型与超长上下文场景,结果出现反转。在Qwen3 4B的26万超长上下文测试中,RTX 5090的24GB显存迅速告急,生成速度骤降至25.28 tokens/sec;而M5 Max仍能稳定输出181.40 tokens/sec,领先幅度接近7倍。
同一张显卡的对比更直观:在68K上下文下尚可跑出160.36 tokens/sec,当上下文扩至262144,受24GB显存上限约束,性能直接暴跌84.2%,吞吐量仅剩21—25 tokens/sec。
测试结论指出,若AI应用侧重高频短文本生成,RTX 5090仍是优选;但若涉及超长文档分析,显存容量的权重可能要排在算力之前。
索尼第一方高调宣传PC版!玩家请愿继续上PC 别管PS
《GTA6》全新截图公布!光影效果惊人
《影之刃零》通关约30小时 极力避免通马桶 刷材料
王老菊的游戏终于要出了!10.23发售 Steam页上线
《对马岛之魂 冥人奇谭》官宣新档期!2028年上线
IGN:《影之刃零》动作手感丝滑 但优化令人担忧