Nvidia breidt Vera Rubin uit met Groq 3 LPX voor agents

Nvidia breidt Vera Rubin uit met Groq 3 LPX voor agents

Nvidia bevestigt dat Groq 3 LPX in volle productie is. De inference accelerator vult Vera Rubin NVL72 aan met snelle tokengeneratie voor agentic AI. Nebius, CoreWeave en SpaceXAI zijn de eerste afnemers.

Groq 3 LPX is een rack-scale systeem dat samen met Vera Rubin NVL72 is ontworpen. In een benchmark van Artificial Analysis met het open source model Gemma 4 31B haalde het systeem 3.400 output tokens per seconde bij long-contextgebruik van 100.000 tokens. Volgens Nvidia is dat vier keer sneller dan het dichtstbijzijnde alternatief.

GPU’s en LPU’s rekenen samen

Rubin-GPU’s nemen de zware contextverwerking voor hun rekening, terwijl de LPU’s zich richten op de latency-gevoelige decodefase. Precies daar zit het pijnpunt: een agent genereert tokens één voor één, en elke vertraging stapelt zich op in lange ketens van taken.

Een rack kan 256 LP30-versnellers bevatten, verbonden via directe chip-to-chip-links. Volgens berichtgeving over de specificaties gaat het om zo’n 315 PFLOPS aan FP8-rekenkracht en 128 GB on-chip SRAM per rack.

Nebius, CoreWeave en SpaceXAI stappen in

Nebius is de eerste AI-cloud die Groq 3 LPX afneemt en zet het systeem in binnen zijn Token Factory. CoreWeave draait inmiddels Spectrum-X Multiplane in productie om Vera Rubin-racks aan elkaar te knopen. SpaceXAI kiest voor Vera CPU’s voor orkestratie, tool use, code-executie en simulatie, van datacenters op aarde tot satellieten in een baan om de aarde.

Spectrum-X Multiplane splitst elke serververbinding op in meerdere onafhankelijke paden. Daarmee schaalt een plat, tweelaags netwerk door naar 512.000 GPU’s zonder een derde netwerklaag. Valt bij een acht-plane-topologie één plane weg, dan blijft ongeveer 90 procent van de bandbreedte overeind.

Tip: SpaceXAI brengt Nvidia Vera Rubin naar de ruimte