01
大语言模型「逐字蹦」式的自回归生成,是推理慢、成本高的核心瓶颈。投机解码(Speculative Decoding)让一个轻量「草稿模型」先猜好一整块字、再由大模型一次并行「批改」,是近年最主流的免费提速思路之一,已被vLLM等主流框架广泛采用。
但它有一条「严格」的批改规则:草稿只要在第一个字上和大模型的最优选择不一致,验证立即停止,后面的草稿全部作废,哪怕大模型其实已经把这一整段都批改完了。
0大语言模型「逐字蹦」式的自回归生成,是推理慢、成本高的核心瓶颈。投机解码(Speculative Decoding)让一个轻量「草稿模型」先猜好一整块字、再由大模型一次并行「批改」,是近年最主流的免费提速思路之一,已被vLLM等主流框架广泛采用。
但它有一条「严格」的批改规则:草稿只要在第一个字上和大模型的最优选择不一致,验证立即停止,后面的草稿全部作废,哪怕大模型其实已经把这一整段都批改完了。
0
评论 (0)