Presentation Information
[B-7-23]分散GPU環境における投機的デコーディングを用いたLLM推論高速化
〇kentaro hayashi1, Kenshiro Wada1, Naoki Kimishima1, Kenzo Okuda1, Hiroki Baba1 (1. NTT, Inc.)
Keywords:
LLM,network,computing
LLMの推論においては,自己回帰的なデコード処理がトークンスループット (TPS) 劣化の主要因となる.投機的デコーディング (SD: Speculative Decoding) は,小型のdraft LLMが将来の複数トークンを予測し,大型のtarget LLMが予測を検証することで,品質を維持しつつ推論を高速化する手法である.低性能や遊休GPUにdraft LLMを配置し,高性能GPUをtargetの検証に集中させる分散型のSDも検討されている.本稿では,NW状態に基づく分散SD構成の最適化を検討する.
