01
大模型提速,原来还有这条路!
上一周,vLLM原班人马创办的Inferact,开源了一套TPU Megakernels(巨型算子)。
他们把Kimi K3的92个MoE层一层不落地写进同一个程序,扔到16颗谷歌TPU v7上跑:
开着投机解码,单用户输出速度达到709 tokens/s;同样16块英伟达GB200,用vLLM跑,是452 tokens/s。
关掉投机解码,在1到8的并发下,它也都是GB200的1.4到2倍。
最扎心的是,按纸面参数,TPU v7的显存带宽(7380GB/s)还比GB200(8000GB/s)低一截。
硬件没占到便宜,赢在了写法上。
还有个彩蛋,这套巨型算子从零编译只要不到90秒。以前在TPU上编译一个同量级的大模型,动辄半小时起步。
0
评论 (0)