AI资讯
TPUv7逆袭GPU:巨核配DSpark揭秘
同样16片、同样vLLM与KimiK3,TPUv7凭Inferact自研megakernel叠加DSpark推测解码,跨层预取拉满带宽利用,实测比GPU快57%。在HBM带宽不占优下,XLA/Pallas与软件调度让TPU逼近极限。
同样16片、同样vLLM与KimiK3,TPUv7凭Inferact自研megakernel叠加DSpark推测解码,跨层预取拉满带宽利用,实测比GPU快57%。在HBM带宽不占优下,XLA/Pallas与软件调度让TPU逼近极限。