#Hardware · 4 Min. Lesezeit · Tim Rinkel

TEMPO-BOMBE! Nvidias neuer Spezial-Chip spuckt 3.400 Token pro Sekunde aus — und geht jetzt in Serie

TEMPO-BOMBE! Nvidias neuer Spezial-Chip spuckt 3.400 Token pro Sekunde aus — und geht jetzt in Serie

Hinweis: Dieser Beitrag enthält Affiliate-Links (mit * gekennzeichnet). Kaufst du über einen dieser Links, erhalte ich eine kleine Provision — für dich ändert sich der Preis nicht.

Nvidia hat am 24. August gemeldet, dass der Groq 3 LPX in Vollproduktion gegangen ist. Das ist der Inferenz-Beschleuniger, der aus der rund 20 Milliarden Dollar schweren Groq-Übernahme hervorging — und er ist nicht dafür gebaut, Modelle zu trainieren, sondern dafür, sie möglichst schnell antworten zu lassen.

WARUM TEMPO PLÖTZLICH ALLES IST

Bei einem normalen Chat merkst du kaum, ob die Antwort eine halbe Sekunde früher kommt. Bei KI-Agenten ist das anders. Ein Agent denkt nicht einmal nach und antwortet — er läuft durch hunderte bis tausende Zwischenschritte: planen, Werkzeug aufrufen, Ergebnis lesen, neu planen. Jeder dieser Schritte kostet Token, und jedes Token kostet Zeit.

Rechne es einmal durch: Wenn ein Schritt eine Sekunde dauert und der Agent 600 Schritte braucht, sitzt du zehn Minuten davor. Halbiere die Zeit pro Schritt — und aus zehn Minuten werden fünf. Genau an dieser Stelle greift der LPX an.

DIE ZAHLEN

Nvidia nennt für den Groq 3 LPX folgende Werte:

  • 3.400 Token pro Sekunde im Benchmark mit Gemma 4 31B bei 100.000 Token Kontextfenster
  • Bis zu viermal schnellere Reaktion für Agenten und latenzkritische Lasten gegenüber der nächstbesten Plattform — nach Herstellerangaben
  • Bis zu 256 Beschleuniger in einem Rack, verbunden über sehr breite Chip-Interconnects

Architektonisch ist der LPX eine Erweiterung der Vera-Rubin-Plattform. Die spezialisierten Inferenz-Einheiten arbeiten dabei nicht statt der GPUs, sondern zusammen mit ihnen — als eine gemeinsame Recheneinheit für die gesamte Gedankenkette eines Agenten. Erster Kunde ist der Cloud-Anbieter Nebius.

Einordnung, weil es sonst untergeht: Die Vergleichswerte stammen vom Hersteller. Unabhängige Messungen stehen noch aus. Bei Inferenz-Benchmarks lohnt sich Skepsis besonders, weil Modellgröße, Kontextlänge, Quantisierung und Batch-Größe die Ergebnisse dramatisch verschieben.

UND DEIN HOMELAB?

Ganz nüchtern: Ein LPX-Rack wird bei dir nicht im Keller stehen. Zwei Dinge betreffen dich trotzdem.

Erstens die Preise für gemietete Inferenz. Wenn spezialisierte Hardware den Token-Durchsatz pro Watt und pro Euro deutlich hebt, wirkt sich das mittelfristig auf die Preise der Anbieter aus — also auf das, was dich API-Aufrufe kosten.

Zweitens die Erwartungshaltung. Je flüssiger Agenten in der Cloud laufen, desto zäher fühlt sich der lokale Betrieb an. Wer zu Hause ernsthaft mit lokalen Modellen arbeiten will, kommt um ausreichend schnellen Grafikspeicher nicht herum. Der Klassiker in dieser Klasse ist nach wie vor eine Karte mit 16 GB VRAM, etwa die ASUS RTX 5060 Ti 16GB* — damit laufen Modelle bis rund 30 Milliarden Parameter in sinnvoller Quantisierung, ohne dass ständig ausgelagert wird.

FAZIT: Die Inferenz wird zum eigenen Markt

Jahrelang drehte sich alles ums Training. Jetzt kippt das Gewicht: Wer Agenten betreibt, bezahlt vor allem für Antworten, nicht fürs Lernen. Der Groq 3 LPX ist das deutlichste Zeichen dafür, dass Nvidia diesen zweiten Markt nicht der Konkurrenz überlassen will. Für dich bleibt es vorerst eine Meldung von weit oben — mit spürbaren Nachwirkungen auf der Rechnung.

Häufige Fragen

Wann ist der Chip verfügbar?
Nvidia hat am 24. August 2026 die Vollproduktion gemeldet. Als erster Kunde ist der Cloud-Anbieter Nebius genannt. Für Endkunden ist das Produkt nicht gedacht — es richtet sich an Rechenzentren, die den Zugang später als Dienst weiterreichen.
Was ist der Unterschied zu einer normalen GPU?
Eine GPU ist ein Allrounder und wird vor allem fürs Training gebraucht. Der LPX ist auf Inferenz zugeschnitten, also auf das schnelle Erzeugen von Token. In der Vera-Rubin-Plattform arbeiten beide zusammen: Die GPUs übernehmen die breiten Rechenlasten, die LPX-Einheiten sorgen für kurze Antwortzeiten.
Sind die genannten Leistungswerte belastbar?
Sie stammen vom Hersteller. Die 3.400 Token pro Sekunde beziehen sich auf Gemma 4 31B mit 100.000 Token Kontext, der Vierfach-Vergleich auf die nach Nvidias Angaben nächstbeste Plattform. Unabhängige Nachmessungen liegen noch nicht vor, und Inferenz-Werte hängen stark von Modell, Quantisierung und Batch-Größe ab.
Lohnt sich das für mein Homelab?
Nicht direkt — die Hardware ist nicht käuflich für Privatanwender. Indirekt kann sich der Trend aber auf die Preise gemieteter Modell-Zugänge auswirken. Wer lokal arbeiten will, fährt weiterhin am besten mit einer Grafikkarte mit reichlich VRAM, weil der Speicher und nicht die Rechenleistung meist der Engpass ist.

Quellen

Kommentar hinterlassen

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert