NewsKategorienWissenNewsletter-ArchivEvents
AnmeldenKostenlos abonnieren
JEDEN MONTAG
Die wichtigsten KI-News der Woche — in 5 Minuten.

Der wöchentliche KI-Newsletter für die Schweiz. Kompakt, relevant, zero Bullshit. 5 Minuten lesen, 1 Woche informiert.

FOLGE UNS
LIXIG
NAVIGATION
KI NewsArchivNewsletter-ArchivAutorenÜber unsKontakt
KATEGORIEN
KI-ForschungKI-BusinessRegulierung & EthikKI in der SchweizKI-Tools & AppsNeue Modelle
WISSEN & REFERENZ
KI-GlossarKI-Events SchweizEvent einreichenLLM-VergleichSchweizer KI-StartupsFirmen & OrganisationenKI-Regulierung SchweizKI-Rechenzentren SchweizKI in der VerwaltungApertus in der Praxis
RECHTLICHES
ImpressumDatenschutzAGB
© 2026 Inoo GmbH · Altstätten SG · Schweiz
Ein Produkt von InooSwiss Made Software
HOME·NEWS·KI-BUSINESS

OpenAIs erster eigener Chip schlägt Nvidia beim Strom

Erste Benchmarks für den Inferenz-Chip Jalapeño: 1,5 bis 1,9 Mal mehr KI-Arbeit pro Watt als Nvidias Blackwell. SemiAnalysis sieht sogar Rubin überholt.

Pascal Eugster
Pascal Eugster
GRÜNDER & ENTWICKLER
26. AUGUST 2026
4 MIN. LESEZEIT
Illustration eines grossen Prozessorchips in Elektroblau auf einer Platine, daneben eine Chilischote und eine Lupenlampe, kinewsletter.ch Stil
Illustration eines grossen Prozessorchips in Elektroblau auf einer Platine, daneben eine Chilischote und eine Lupenlampe, kinewsletter.ch Stil
INHALT
01Neun Monate vom Reissbrett in die Fabrik02Warum Watt die neue Währung ist03Der CUDA-Burggraben bekommt Risse04Was die Zahlen nicht zeigen05Lugano rechnet mit sieben Megawatt
INHALT
01Neun Monate vom Reissbrett in die Fabrik02Warum Watt die neue Währung ist03Der CUDA-Burggraben bekommt Risse04Was die Zahlen nicht zeigen05Lugano rechnet mit sieben Megawatt
in
PARTNER · INOO GMBH
Wie viel KI verträgt dein Betrieb? In 30 Minuten Klartext.

Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.

Gespräch buchen →
DAS WICHTIGSTE IN KÜRZE

Ein Chip der ersten Generation schlägt etablierte Nvidia-Hardware bei Durchsatz pro Watt – und weil Rechenzentren durch Strom limitiert sind, entscheidet genau diese Kennzahl über die künftigen Inferenzkosten. Auch für Schweizer Firmen, die KI über die API einkaufen.

OpenAI hat am 25. August 2026 an der Hot-Chips-Konferenz in Stanford die ersten gemessenen Benchmarks für «Jalapeño» vorgelegt – den ersten selbst entworfenen Inferenz-Chip des Unternehmens, gemeinsam mit Broadcom entwickelt. Auf dem öffentlichen InferenceX-Benchmark der Analysefirma SemiAnalysis liefert Jalapeño laut OpenAI 1,5 bis 1,9 Mal mehr KI-Arbeit pro Watt und 1,7 bis 3,6 Mal tiefere Antwortzeiten als die aktuell besten kommerziell verfügbaren Systeme – gemessen gegen Nvidias Blackwell-Generation. Dass ein Chip der ersten Generation etablierte Hardware schlägt, ist in der Halbleiterbranche die grosse Ausnahme.

Inferenz heisst: Der Chip lässt fertig trainierte KI-Modelle laufen, er trainiert sie nicht. Genau dort entstehen die laufenden Kosten – jede ChatGPT-Antwort, jeder API-Aufruf, jeder Agenten-Schritt.

Neun Monate vom Reissbrett in die Fabrik

Jalapeño wurde erst im Juni 2026 überhaupt angekündigt. Der Designstart lag Mitte 2024, das Tape-out – der Moment, in dem der fertige Entwurf zur Fertigung geht – im November 2025. OpenAI beziffert die Spanne vom ersten Chip-Design bis zum fertigen Blueprint auf neun Monate. Für einen Hochleistungs-ASIC ist das brutal schnell.

Geholfen haben dabei die eigenen Modelle. Ältere Generationen unterstützten den Entwurf, neuere die Optimierung. Konkret nennt OpenAI 8 Prozent weniger Fläche bei den SIMD-Einheiten und 10 Prozent bei der Matrix-Engine. Für ausgewählte Bausteine von GPT-OSS liefen KI-geschriebene Kernel 1,5 bis 1,8 Mal schneller als die Varianten menschlicher Experten.

Warum Watt die neue Währung ist

Die entscheidende Kennzahl ist nicht Leistung pro Chip, sondern Leistung pro Watt. SemiAnalysis begründet das nüchtern: Rechenzentren sind heute durch verfügbaren Strom limitiert, nicht durch Budget oder Fläche. Neue GPUs lassen sich schneller beschaffen als neue Netzanschlüsse.

Jalapeño ist mit 700 Watt spezifiziert, im Test blieb der Verbrauch bei 550 Watt oder darunter. Die Vergleichssysteme GB200 und GB300 liegen bei 1'200 respektive 1'400 Watt. Getestet wurde auf drei offenen Modellen: GPT-OSS 120B, DeepSeek R1 670B und Kimi K2.5 1T. Auf GPT-OSS erreichte der Chip rund 1'459 Token pro Sekunde und Nutzer, bei DeepSeek R1 über 700 Token pro Sekunde bei einer einzelnen Anfrage.

«The bottom line is that the results show a very, very significant performance advance over state of the art.» – Richard Ho, Head of Hardware bei OpenAI, in einem Presse-Call

Bemerkenswert: Jalapeño schafft das ohne Multi-Token-Prediction und ohne spekulatives Decoding – zwei gängige Beschleunigungstricks, die einige Vergleichssysteme sehr wohl nutzten. Da liegt also noch Luft drin.

Der CUDA-Burggraben bekommt Risse

SemiAnalysis-CEO Dylan Patel ordnet es so ein: «Usually first generation chips aren't competitive, but OpenAI is beating Nvidia Blackwell and even Rubin.» Die Analysten halten den Blackwell-Vergleich selbst für unfair – der richtige Gegner sei Nvidias neuere Vera-Rubin-Plattform, weil beide HBM4-Speicher nutzen. Auch dort liegt Jalapeño bei den Ausgabe-Token pro Megawatt vorn; bei den Gesamtbetriebskosten pro Token sind beide etwa gleichauf.

Der eigentliche Sprengsatz steckt in der Software. Nvidias Vorsprung beruhte jahrelang auf CUDA – dem Ökosystem, das jeder Konkurrent erst nachbauen muss. OpenAI brachte drei nicht eingeplante Open-Weight-Modelle in zwei Monaten mit Codex auf Tempo. SemiAnalysis' Fazit: «The CUDA moat is potentially dead given how fast OpenAI can bring up new models on their silicon.»

Was die Zahlen nicht zeigen

Die Skepsis gehört dazu. Alle Messwerte stammen von OpenAI selbst; SemiAnalysis hat einzelne Läufe vor Ort im Labor nachvollzogen, aber nicht die volle Benchmark-Suite gefahren. Getestet wurde nur ein vergleichsweise einfaches 8k/1k-Profil, nicht die mehrstufigen Langkontext-Lasten, die echte Agenten erzeugen. Nvidia und AMD haben längst Resultate auf grösseren Modellen publiziert, die auf Jalapeño noch gar nicht laufen. Und der wichtigste Punkt: Vera-Rubin-Systeme werden bereits an Kunden ausgeliefert, während Jalapeño über Engineering-Samples nicht hinaus ist. Richard Ho rechnet mit einem Deployment «in sehr kleinen Stückzahlen» Ende 2026, ernsthaft erst 2027.

Lugano rechnet mit sieben Megawatt

Für dich in der Schweiz ist die Energie-Rechnung der interessante Teil. Der nationale Supercomputer Alps am CSCS in Lugano – jene Maschine, auf der ETH und EPFL das Schweizer Sprachmodell Apertus trainiert haben – zieht im Schnitt rund sieben Megawatt. Das entspricht dem Verbrauch von 10'000 Schweizer Haushalten, wie der Nachhaltigkeitsforscher Vlad Coroama gegenüber SWI swissinfo vorgerechnet hat; der Strom kommt laut CSCS ausschliesslich aus Wasserkraft. Ein Zwei-Rack-System mit 128 Jalapeño-Chips zieht demgegenüber etwa 160 Kilowatt.

Rechenzentren stossen auch hierzulande an Netz- und Bewilligungsgrenzen, und Schweizer Strom ist nicht billig. Wenn pro Kilowattstunde mehr Token herausfallen, verschiebt das die Wirtschaftlichkeit jeder KI-Anwendung – auch der Schweizer. OpenAI-Finanzchefin Sarah Friar argumentiert genau so: Effizienzgewinne senken die Kosten pro erfolgreichem Resultat, und die zahlst du am Ende in der API-Rechnung.

Gen 2 ist laut OpenAI bereits weit in der Entwicklung, Gen 3 nimmt Form an. Nvidia bleibt vorerst Lieferant und Partner – aber der Preisdruck hat gerade einen Namen bekommen.

Quellen

Jalapeño's first results show industry-leading speed and efficiency in AI inference – OpenAI↗ EXTERNER LINKThe full stack behind abundant intelligence – Sarah Friar, OpenAI↗ EXTERNER LINKOpenAI and Broadcom unveil LLM-optimized inference chip – OpenAI↗ EXTERNER LINKOpenAI's Jalapeño chip is built for fast inference at scale, benchmarks show – TechCrunch↗ EXTERNER LINKOpenAI Jalapeño: Better Than Nvidia Blackwell – SemiAnalysis↗ EXTERNER LINKOpenAI's first custom chip "Jalapeño" reportedly beats Nvidia's Blackwell and Rubin in inference benchmarks – The Decoder↗ EXTERNER LINKOpenAI's upcoming Jalapeño chip looks like it'll be an inference beast – The Register↗ EXTERNER LINKBroadcom and OpenAI unveil custom-built Jalapeño inference processor – Tom's Hardware↗ EXTERNER LINKWhat's the environmental cost of Switzerland's new supercomputer? – SWI swissinfo↗ EXTERNER LINKApertus: a fully open, transparent, multilingual language model – ETH Zürich↗ EXTERNER LINK
FIRMEN IN DIESEM ARTIKEL
NvidiaOpenAIDeepSeekETH ZürichEPFL
TEILEN
LinkedIn→X / Twitter→E-Mail→
KOSTENLOS ABONNIEREN
Diese News jeden Montag in dein Postfach?

WEITERLESENDas könnte dich auch interessieren.

Illustration einer Drehtür in einer Marmorlobby mit Aktenkoffer und Säule, kinewsletter.ch Stil
Illustration einer Drehtür in einer Marmorlobby mit Aktenkoffer und Säule, kinewsletter.ch Stil
KI-BUSINESS·25. AUGUST 2026

Nvidia soll bei Perplexity einsteigen – laut einem einzigen Bericht

Laut einem Bericht von The Information verhandelt Nvidia über eine Beteiligung an Perplexity – bei einer Bewertung von über 30 Milliarden Dollar. Bestätigt ist nichts: Alle Meldungen gehen auf diesen einen Bericht mit anonymen Quellen zurück. Aufschlussreicher als das Gerücht ist das Muster dahinter – Nvidia investiert seit Jahren in die eigenen Kunden.

Illustration eines Bibliotheks-Lesesaals mit einer freistehenden elektroblauen Tür und einem Messingschlüssel auf einem Pult, kinewsletter.ch Stil
Illustration eines Bibliotheks-Lesesaals mit einer freistehenden elektroblauen Tür und einem Messingschlüssel auf einem Pult, kinewsletter.ch Stil
Nur für Abonnenten·KI-BUSINESS·25. AUGUST 2026

Thomson Reuters baut eigenes KI-Modell – und mietet trotzdem Claude

Thomson Reuters hat rund 40 Millionen Dollar in ein eigenes Sprachmodell für Rechtsarbeit gesteckt. Die letzte Trainingsrunde kostete davon nur 450'000 – der Rest ging in Personal und Content. Und das wichtigste Produkt läuft weiterhin auf Anthropics Claude Agent SDK. Was Schweizer Firmen aus dieser Rechnung lernen.

Illustration einer Börsenhalle mit Ticker-Maschine und Handglocke, kinewsletter.ch Stil
Illustration einer Börsenhalle mit Ticker-Maschine und Handglocke, kinewsletter.ch Stil
KI-BUSINESS·25. AUGUST 2026

Anthropic macht 65 Milliarden Umsatz – zu wenig für 2 Billionen

Die Financial Times hat Anthropics Finanzzahlen vor dem geplanten Börsengang offengelegt: 65 Milliarden Dollar annualisierter Umsatz, der erste operative Gewinn und 6'000 Grosskunden. Beeindruckend – und trotzdem erst ein Drittel dessen, was die angestrebte Bewertung von 2 Billionen Dollar verlangt.

Illustration eines Auktionsraums mit leeren Stuhlreihen, Hammer und einer einzigen erhobenen blauen Bieterkelle, kinewsletter.ch Stil
Illustration eines Auktionsraums mit leeren Stuhlreihen, Hammer und einer einzigen erhobenen blauen Bieterkelle, kinewsletter.ch Stil
KI-BUSINESS·25. AUGUST 2026

Hugging Face soll Verkauf prüfen – 13 Milliarden im Raum

Laut einem Exklusivbericht von Business Insider soll Hugging Face Übernahmeinteresse ab 13 Milliarden Dollar erhalten haben – fast das Dreifache der letzten bekannten Bewertung. Bestätigt ist davon nichts: Alle Meldungen gehen auf dieselbe Quelle zurück, das Unternehmen schweigt. Für die Schweiz ist die Frage trotzdem relevant, denn Apertus von ETH, EPFL und CSCS wird über Hugging Face verteilt.

Illustration einer Wand mit analogen Zählern und einem grossen Zeigerinstrument, kinewsletter.ch Stil
Illustration einer Wand mit analogen Zählern und einem grossen Zeigerinstrument, kinewsletter.ch Stil
KI-BUSINESS·24. AUGUST 2026

KI-Agenten überholen Menschen: 14-mal mehr Tokens

Auf OpenRouter verbrauchen KI-Agenten seit Anfang Februar 2026 mehr Tokens als Menschen – ihr Verbrauch ist seither um das 14-Fache gestiegen, der menschliche nur um das 2,8-Fache. Ein agentischer Auftrag frisst rund 15-mal mehr Tokens als eine Chat-Anfrage. Wer KI-Budgets noch für Chat plant, plant falsch.

Illustration einer Werkbank mit gestapelten Speichermodulen und einer Balkenwaage, kinewsletter.ch Stil
Illustration einer Werkbank mit gestapelten Speichermodulen und einer Balkenwaage, kinewsletter.ch Stil
KI-BUSINESS·23. AUGUST 2026

Nvidia-Server werden laut Bloomberg über 15 Prozent teurer

Grosse Nvidia-Kunden wurden laut Bloomberg informiert: Server mit Nvidias KI-Chips werden in vielen Fällen über 15 Prozent teurer. Grund sind die explodierenden Speicherpreise.

Mehr aus KI-Business →