Amazon Web Services beschreibt Möglichkeiten zur Reduzierung von Ausgaben bei der Nutzung von Foundation-Modellen in Amazon Bedrock. Wenn Sie wiederholt denselben Kontext an die Modelle senden, können Sie die Kosten für Eingabe-Tokens mithilfe von Prompt Caching um bis zu 90 Prozent senken. Diese Technik setzt direkt an wiederkehrenden Datenmengen an, um redundante Verarbeitungsprozesse zu minimieren.
Die praktische Umsetzung demonstriert der Anbieter anhand von sechs konkreten Szenarien über die Converse-API. Thematisiert werden dabei unter anderem die Optimierung von Nachrichteninhalten, System-Prompts sowie Werkzeugdefinitionen. Zudem erfahren Sie Details zum Einsatz gemischter TTL-Werte, zur Isolation einzelner Mandanten und zur Einbindung in das Framework LangChain.

