Zum Inhalt springen
AI ConnectPowered by VELENTIS
KI-generiert1 Min.

AWS führt präfixbasiertes Routing für Amazon SageMaker Inference ein

Amazon SageMaker Inference bietet nun ein präfixbasiertes Routing an. Die Methode soll Latenzzeiten senken und die Trefferquote im KV-Cache bei großen Sprachmodellen deutlich steigern.

Dieser Beitrag wurde KI-generiert und automatisch veröffentlicht. Einordnung, Kennzeichnung und alle Quellen am Beitragsende.

(KI-generiertes Symbolbild: Gemini / AI Connect)

Der Cloud-Anbieter AWS erweitert seine Plattform mit einer gezielten Optimierung für Sprachmodelle. Amazon SageMaker Inference stellt Entwicklern ab sofort ein sogenanntes präfixbasiertes Routing zur Verfügung. Dieses Verfahren leitet eingehende Anfragen mit identischen Prompt-Präfixen gezielt an dieselbe Instanz weiter. Auf diese Weise bleibt der sogenannte KV-Cache warm, was die erneute Verarbeitung bereits bekannter Textelemente vermeidet.

Die Auswirkungen des neuen Routing-Mechanismus wurden in Messungen mit dem Modell Llama 3.1 70B dokumentiert. Laut den veröffentlichten Daten sank die P50-Latenz bis zur Generierung des ersten Tokens um bis zu 77 Prozent. Gleichzeitig kletterte die Trefferquote innerhalb des Caches von anfänglich rund 25 Prozent auf über 80 Prozent. Für Workloads mit wiederkehrenden System-Prompts oder geteilten Kontexten ermöglicht dieser Ansatz eine spürbare Effizienzsteigerung.

Was heißt das für Sie?

Für Entwickler und Unternehmen, die große Sprachmodelle über SageMaker hosten, bedeutet dieses Feature spürbar kürzere Antwortzeiten bei wiederkehrenden Kontexten. Durch die deutlich höheren Cache-Trefferquoten lässt sich die Auslastung der bereitgestellten Instanzen optimieren. Sie können dadurch die Effizienz Ihrer KI-Infrastruktur verbessern, ohne zwingend zusätzliche Rechenressourcen anmieten zu müssen.

Belege

Solide belegt
46/100
  • Amazon SageMaker Inference bietet ab sofort eine Routing-Strategie namens prefix-aware routing an.

    eine Quelle
    Zitat

    Amazon SageMaker Inference now offers prefix-aware routing

  • Das System leitet Anfragen mit demselben Prompt-Präfix an dieselbe Instanz weiter, um den KV-Cache warmzuhalten.

    eine Quelle
    Zitat

    sends requests sharing the same prompt prefix to the same instance so the KV cache stays warm.

  • In Benchmarks mit Llama 3.1 70B sank die P50-Latenz bis zum ersten Token um bis zu 77 Prozent.

    eine Quelle
    Zitat

    In benchmarks on Llama 3.1 70B, it reduced P50 time-to-first-token by up to 77%

  • Die Trefferquote des KV-Caches stieg in den Benchmarks von ungefähr 25 Prozent auf über 80 Prozent.

    eine Quelle
    Zitat

    raised KV cache hit rates from about 25% to over 80%.

Der Beleg-Score wird berechnet, nicht handgesetzt: aus Vertrauensgrad, Quellenzahl und dem Anteil verifizierter Aussagen.

Quelle & Transparenz

Stand: 10. September 2026

KI-generiertKI-generiert: automatisiert aus geprüften Quellen erstellt und technisch qualitätsgesichert (Quellen-, Zitat- und Zahlenabgleich); keine menschliche Einzelfreigabe vor Veröffentlichung

Quellen
1
Verifizierte Aussagen
0 / 4
Beleg-Score
46Solide belegt

Wollen Sie das umsetzen?

Wir vermitteln Ihnen passende KI-Anbieter aus der DACH-Region, kostenlos und unverbindlich.

Wie geht's weiter?