Amazon SageMaker InferenceのPrefix-Aware Routing
Amazon SageMaker Inferenceのprefix-aware routingは、大規模言語モデル(LLM)の推論遅延を削減するために導入されたルーティング戦略であり、キャッシュの再利用を可能にします。Llama 3.1 70B Instructを用いたベンチマークでは、prefix-aware routingによりP50 TTFTが最大77%削減され、トータルスループットが最大16%向上しました。Amazon SageMaker Inferenceとprefix-aware routingを活用することで、LLMの推論遅延を削減し、モデルのスループットを向上させることができます。