Zum Inhalt springen
AI ConnectPowered by VELENTIS
KI-generiert1 Min.

Nvidia startet Serienfertigung des Inferenz-Racks Groq 3 LPX für Agenten-Workflows

Nvidia hat auf der Konferenz Hot Chips 2026 die Serienproduktion des Inferenzsystems Groq 3 LPX verkündet, das 256 LPUs für extrem schnelles Token-Decoding nutzt.

Dieser Beitrag wurde KI-generiert und automatisch veröffentlicht. Einordnung, Kennzeichnung und alle Quellen am Beitragsende.

(KI-generiertes Symbolbild: Gemini / AI Connect)

Auf der Fachkonferenz Hot Chips 2026 hat Nvidia die Serienproduktion seines neuen Inferenz-Racks Groq 3 LPX bekanntgegeben. Das System markiert einen bedeutenden Schritt in der Hardware-Architektur für künstliche Intelligenz, da es gezielt auf die Anforderungen moderner Agenten-Workflows zugeschnitten ist. Mit der vollständigen Fertigungsfreigabe reagiert der Chiphersteller auf die steigende Nachfrage nach minimaler Inferenzlatenz und hohem Durchsatz in Produktivumgebungen.

Die Architektur des Groq 3 LPX kombiniert Nvidias Vera-Rubin-Plattform mit spezialisierter Inferenz-Hardware. Während die Rubin-Komponenten die Phasen des Trainings sowie des Prefills übernehmen, sind 256 dedizierte Language Processing Units für das eigentliche Token-Decoding zuständig. Diese LPUs werden im 4-Nanometer-Verfahren beim Auftragsfertiger Samsung hergestellt und basieren auf der Technologie aus der Groq-Transaktion.

Im Praxiseinsatz und in Benchmarks von Artificial Analysis erzielt das neue System Spitzenwerte von bis zu 3.400 Tokens pro Sekunde. Dieser massive Zuwachs bei der Ausführungsgeschwindigkeit adressiert direkt das zentrale Problem komplexer KI-Agenten, die in iterativen Schleifen agieren. Bei solchen mehrstufigen Denkprozessen bildete die reine Latenz der Token-Generierung bisher einen gravierenden Engpass für die Benutzererfahrung.

Als erster Cloud-Anbieter wird Nebius das System live in Betrieb nehmen und für Unternehmenskunden zugänglich machen. Dadurch können Entwickler und Unternehmen die neue Inferenz-Leistung über Cloud-Instanzen nutzen, ohne eigene physische Racks installieren zu müssen. Die Zusammenarbeit soll die Einführung neuer agentischer Anwendungen in der Praxis beschleunigen.

Mit dem Produktionsstart festigt Nvidia seine Marktposition im Bereich der Inferenz-Infrastruktur, der zunehmend gegenüber dem reinen Modelltraining an wirtschaftlicher Bedeutung gewinnt. Durch die Trennung von Prefill- und Decoding-Phasen auf heterogener Hardware setzt das Unternehmen auf spezialisierte Rechenzentrumsarchitekturen. Die Auslieferung der Serienmodelle soll die verfügbaren Kapazitäten für rechenintensive Sprachmodelle spürbar erweitern.

Was heißt das für Sie?

Für Entwickler und Unternehmen bedeuten Inferenz-Geschwindigkeiten von bis zu 3.400 Tokens pro Sekunde, dass mehrstufige Agenten-Workflows praxistauglich werden. Durch Cloud-Partner wie Nebius sinkt die Einstiegshürde, da keine eigenen Spezial-Racks angeschafft werden müssen.

Perspektiven

Berichterstattung: 1× USA · 3× Weitere

Dieselbe Geschichte, mehrere Blickwinkel: So rahmen die Quellen das Thema, jeweils mit wörtlichem Zitat.

Einordnung: 1× Anbieter-PR

  • nvidianews.nvidia.comAnbieter-PRUSA

    Die offizielle Pressemitteilung stellt die weltklasse Geschwindigkeit und die extrem schnelle Token-Generierung des Beschleunigers fuer reaktionsschnelle Agenten-Systeme innerhalb der Vera-Rubin-Plattform in den Mittelpunkt.

    Originalzitat

    NVIDIA today announced that NVIDIA Groq 3 LPX , the interactive AI inference accelerator, is now in full production.

    nvidianews.nvidia.com
  • koreaherald.comWeitere

    Die Quelle beleuchtet die wirtschaftliche Perspektive fuer Samsung Electronics und betont, dass die Fertigung der 4-Nanometer-LPUs die verlustbehaftete Foundry-Sparte wieder in die Gewinnzone fuehren koennte.

    Originalzitat

    Nvidia has begun mass production of its Groq 3 LPX inference accelerator, with Samsung Electronics manufacturing the key chips,

    koreaherald.com
  • servethehome.comWeitere

    Der Bericht analysiert die technische Architektur detailliert und beschreibt, wie die LPUs mit On-Die-SRAM eine Schwaeche der Vera-Rubin-GPUs beim Inferenz-Decode mit geringer Latenz ausgleichen.

    Originalzitat

    Groq’s LPUs are designed to fill a weak spot in NVIDIA’s Vera Rubin stack.

    servethehome.com
  • fool.comWeitere

    Der Artikel analysiert die Entwicklung aus Anlegerperspektive und hebt die schnelle Integration der 20-Milliarden-Dollar-Groq-Vereinbarung sowie die nahtlose CUDA-Kompatibilitaet hervor.

    Originalzitat

    LPX can be paired with Nvidia’s new Vera Rubin chips without customers changing their CUDA workflows

    fool.com

Einordnung der Quellen redaktionell gepflegt (politisches Spektrum nur bei breitem Konsens; Anbieter-Kommunikation ist PR, kein Journalismus). Quellen ohne Etikett sind nicht eingeordnet — wir raten nicht.

Belege

Solide belegt
69/100

Quelle & Transparenz

Stand: 26. August 2026

KI-generiertKI-generiert: automatisiert aus geprüften Quellen erstellt und technisch qualitätsgesichert (Quellen-, Zitat- und Zahlenabgleich); keine menschliche Einzelfreigabe vor Veröffentlichung

Quellen
4
Verifizierte Aussagen
1 / 3
Beleg-Score
69Solide belegt

Wollen Sie das umsetzen?

Wir vermitteln Ihnen passende KI-Anbieter aus der DACH-Region, kostenlos und unverbindlich.

Wie geht's weiter?