Der Cloud-Anbieter AWS erweitert seine Plattform mit einer gezielten Optimierung für Sprachmodelle. Amazon SageMaker Inference stellt Entwicklern ab sofort ein sogenanntes präfixbasiertes Routing zur Verfügung. Dieses Verfahren leitet eingehende Anfragen mit identischen Prompt-Präfixen gezielt an dieselbe Instanz weiter. Auf diese Weise bleibt der sogenannte KV-Cache warm, was die erneute Verarbeitung bereits bekannter Textelemente vermeidet.
Die Auswirkungen des neuen Routing-Mechanismus wurden in Messungen mit dem Modell Llama 3.1 70B dokumentiert. Laut den veröffentlichten Daten sank die P50-Latenz bis zur Generierung des ersten Tokens um bis zu 77 Prozent. Gleichzeitig kletterte die Trefferquote innerhalb des Caches von anfänglich rund 25 Prozent auf über 80 Prozent. Für Workloads mit wiederkehrenden System-Prompts oder geteilten Kontexten ermöglicht dieser Ansatz eine spürbare Effizienzsteigerung.

