Google $GOOGL führte zwei neue KI-Chips ein auf seiner Cloud Next-Konferenz in dieser Woche und trennte dabei erstmals Training und Inferenz in unterschiedliche Prozessoren in der achten Generation der Tensor-Prozessoren des Unternehmens.
Der TPU 8t richtet sich auf das Modelltraining, während der TPU 8i Inferenz-Arbeitslasten übernimmt, eine Aufteilung im Vergleich zu früheren Generationen, die beide Aufgaben erledigten.

NurPhoto / Getty Images
Google $GOOGL führte zwei neue KI-Chips ein auf seiner Cloud Next-Konferenz in dieser Woche und trennte dabei erstmals Training und Inferenz in unterschiedliche Prozessoren in der achten Generation der Tensor-Prozessoren des Unternehmens.
Der TPU 8t ist zum Trainieren von KI-Modellen gebaut, während der TPU 8i für Inferenz und die Handhabung von KI-Agenten-Workloads konzipiert ist. Beide Chips werden später in diesem Jahr verfügbar sein, sagte Google.
Bis jetzt hat ein einziger Chip sowohl Training als auch Inferenz bei allen TPU-Generationen bewältigt. Spezialisierte Hardware für jede Arbeitslast wurde zu einer Priorität, da die Bereitstellungen von KI-Agenten zunahmen und die Leistungsanforderungen für Training und Inferenz weiter auseinanderdrifteten, sagte Google.
Google entwarf die Chips in Zusammenarbeit mit Google DeepMind. CEO Sundar Pichai sagte, die Architektur sei dafür konzipiert, "den massiven Durchsatz und die niedrige Latenz zu liefern, die erforderlich sind, um Millionen von Agenten gleichzeitig kostengünstig auszuführen."
Die Kundenbasis für Googles TPUs wächst. Zu den von Google genannten Nutzern zählen Citadel Securities, die sich auf TPUs für quantitative Forschung stützen, und alle 17 nationalen Labors im US-Energieministeriumssystem, die KI-Software auf den Chips ausführen. Anthropic hat sich verpflichtet, mehrere Gigawatt an TPU-Kapazität von Google zu nutzen, und Yahoo Finanzen berichtet, dass Google ebenfalls in Gesprächen ist, um OpenAI TPU-Kapazitäten bereitzustellen. Ein mehrjähriges, multibillionen Dollar schweres Abkommen, das Meta $META Zugang zu Googles TPUs gewährt, wurde ebenfalls im Februar geschlossen. CNBC berichtete unter Berufung auf The Information.
Seit 2018, als Google erstmals TPUs für externe Cloud-Kunden verfügbar gemacht hat, dienen die Chips als interne Option für Unternehmen, die Alternativen zur Beschaffung von Nvidia $NVDA-Hardware suchen. Das Unternehmen vergleicht die Leistung der neuen Chips nicht direkt mit den Prozessoren von Nvidia.
Im Vergleich zur siebten Generation Ironwood bietet die TPU 8t 2,8-fache Leistung zu gleichwertigen Kosten, sagte Google. Im Superpod-Maßstab unterstützt der Chip Konfigurationen von bis zu 9.600 Einheiten mit zwei Petabyte gemeinsam genutztem Hochgeschwindigkeitsspeicher und zielt auf mehr als 97 % nützliche Rechenzeit ab. Laut Google bedeutet dies, dass die Zeit, die benötigt wird, um fortschrittliche Modelle zu entwickeln, von Monaten auf Wochen reduziert wird.
Der On-Chip-SRAM in der TPU 8i beträgt 384 Megabyte, was dreimal so viel ist wie bei Ironwood, und der Chip umfasst außerdem 288 Gigabyte Hochgeschwindigkeitsspeicher, wobei das Gesamtdesign auf Inferenz mit niedriger Latenz ausgerichtet ist. Für Inferenz-Workloads erreicht die Leistungssteigerung pro Dollar gegenüber der vorherigen Generation 80 %, was laut Google den Kunden ermöglicht, etwa das doppelte Anfragevolumen zu bewältigen, ohne die Ausgaben zu erhöhen.
Beide Chips laufen auf Googles Axion ARM-basierten CPUs und unterstützen Frameworks wie JAX, PyTorch, SGLang und vLLM. Sie können als Teil des AI-Hypercomputersystems von Google verwendet werden, das Hardware, Software und Netzwerk in einem einheitlichen Stack kombiniert.
Schließen Sie sich über 500.000 Lesern an, die ihren Tag mit Quartz beginnen.
Mit dem Abonnieren stimmen Sie unseren Nutzungsbedingungen und unserer Datenschutzrichtlinie zu.