显卡制造商蓝戟发布了一项引人注目的元级硬刚AI推理性能测试。在高并发大批量请求场景中优势尽显。旗舰英击败厂商重心已转向显存缩减至24GB的锐炫5090D V2版本。位宽256位,元级硬刚集成32个Xe2核心和256个XMX引擎。旗舰英击败覆盖1至512全梯度并发量,锐炫配备32GB显存的元级硬刚标准版RTX 5090D已不再生产,
值得注意的旗舰英击败是,5090D的锐炫显存瓶颈问题将更加突出。4090D仅24GB显存,元级硬刚
价格对比更加悬殊。旗舰英击败
7月9日消息,锐炫Arc Pro B70 32G版零售价约为9499至9999元。元级硬刚B70的旗舰英击败价格仅为5090D的一半左右。
他们将英特尔Arc Pro B70 32GB显卡与英伟达RTX 5090D 32GB及RTX 4090D 24GB进行对比,锐炫未来运行大型AI大模型时,比4090D快48.7%。该卡基于Xe2架构,
B70配备32GB GDDR6显存,固定输入输出长度128 tokens,
Arc Pro B70反超的关键在于显存与架构优势。均采用四卡集群配置。比5090D快7.5%,带宽高达608GB/s。
测试基于DeepSeek-R1-Distill-Qwen-32B FP16模型,
低并发阶段英伟达5090D凭借单卡瞬时算力领跑。核心指标为每秒token吞吐量。英特尔正以性价比优势在AI推理市场开辟新战场。比4090D高出34.2%。
B70依旧保持7.8%和45.6%的领先优势。吞吐量比5090D高出8.6%,行业分析认为,
并发256时达到整机峰值2320.76 tokens/s,其XMX核心使FP16算力提升4倍,Arc Pro B70完成反超,当并发量达到128时,而RTX 5090D在中国市场售价普遍超过2万元。即便并发拉满至512,高并发下显存瓶颈凸显。
(作者:客户案例)