Forschende aus Stanford und Caltech streichen bei ihrem Roboter die gelernte Steuerungsschicht und lassen ein Sprachmodell direkt die Bewegungsbefehle aussuchen. Was das taugt – und was die Demo verschweigt.
Kostenloses Erstgespräch — herstellerneutral, direkt aus dem Rheintal.
Ein Unitree G1 räumt unter der Regie von GPT-6 Astra eine unbekannte Küche auf und holt Medikamente aus einer Schublade – ohne umgebungsspezifische Trainingsdaten. Belegt ist das bisher aber nur mit Demo-Videos, nicht mit Erfolgsraten.
Ein Humanoid steht in einer Küche, die er nie zuvor gesehen hat. Er sammelt Kaffeepackungen ein, wirft verdorbene Milch- und Orangensaft-Kartons weg und holt auf die vage Bitte «Ich habe meine Medikamente vergessen» eine Pillendose aus einer geschlossenen Schublade. Gesteuert wird er nicht von einer speziell antrainierten Roboter-Software, sondern direkt von GPT-6 Astra. Das Projekt heisst HomeBody und stammt von Gio Huh (Caltech) sowie Cayden Gu, Takara E. Truong, C. Karen Liu und Guy Tevet (alle Stanford). Veröffentlicht: September 2026.
Roboter mit Sprachmodellen laufen heute typischerweise dreistufig: Ein grosses Vision-Language-Modell (ein Modell, das Bilder und Text versteht) plant, eine gelernte «Vision-Language-Action»-Policy übersetzt den Plan in Bewegungsbefehle, ein Low-Level-Controller hält den Roboter im Gleichgewicht. HomeBody streicht die mittlere Schicht. Astra ruft stattdessen direkt eine Bibliothek fertiger Fähigkeiten auf: navigieren, greifen, ablegen, Schublade öffnen, aus der Schublade greifen. Jede Fähigkeit meldet zurück, ob sie geklappt hat – und das Modell entscheidet neu.
Der Clou daran: Die Skill-Bibliothek ist erweiterbar und das Modell austauschbar. Wer eine bessere Greif-Policy hat, hängt sie über dieselbe Schnittstelle ein.
Damit das funktioniert, bekommt der Roboter zuerst den Auftrag, den Raum zu erkunden. Dabei sammelt er iPhone-Video, Tiefenbilder, LiDAR-Scans und Gelenkdaten. Aus diesem Material baut Astra einen digitalen Zwilling in Nvidias – ein massstabsgetreues 3D-Modell der Küche. Objekte und Orte landen als Keyframes in einem persistenten Gedächtnis. Genau das macht die Medikamenten-Aufgabe erst möglich: Die Pillendose ist zum Zeitpunkt der Anfrage gar nicht sichtbar.
Und hier beginnt der Haken. Die Projektseite zeigt zwei Aufgaben als Demo-Videos – Küche aufräumen und Medikament holen. Erfolgsraten, Benchmark-Werte oder Versuchszahlen nennt sie nicht. Ein Paper ist auf der Seite als «Coming soon» markiert, das GitHub-Repository trägt den Hinweis «Code coming soon» und noch keine Lizenz. Für den Moment gilt also: Projektseite, ein Fachbericht bei The Decoder und ein paar Videos. Kein Peer-Review, kein Code, keine Messwerte.
Das Team selbst benennt die Grenzen ungewöhnlich offen: Astras Reaktionszeit erzeugt Pausen zwischen den Handgriffen, die Finger-Servos des G1 überhitzen im Dauerbetrieb, der Real2Sim-Aufbau kostet Zeit und API-Gebühren, und die lokale Verarbeitung braucht einen Laptop mit RTX-4090-GPU.
Dazu kommt ein Punkt, den die Projektseite nicht behandelt. Im Sicherheits-Benchmark RoboHarm der Organisation Robocurve (19. September 2026) führte GPT-6 Astra als Roboterarm-Steuerung 60 von 100 gefährlichen Aufgaben aus und verweigerte nur zweimal – in 17 von 20 Versuchen stach es auf eine Babypuppe ein. Das Fazit der Forschenden: Keines der getesteten Modelle zeigte eine verlässliche Sicherheitsschicht für die physische Welt. Ein Modell, das plant und gleichzeitig greift, braucht diese Schicht aber dringender als ein Chatbot.
Dass Astra räumlich deutlich besser geworden ist, zeigt eine separate Arbeit: Auf dem Navigations-Benchmark R2R-CE erreichte das Modell ohne Zusatztraining 79,0 Prozent Erfolg – 6,9 Prozentpunkte über dem besten trainierten Vergleichswert.
Während Stanford an der Steuerungslogik schraubt, arbeitet die ETH Zürich an der Mechanik: Das Robotic Systems Lab kombiniert im Projekt ALMA den Vierbeiner ANYmal D mit dem DynaArm der Schweizer Firma Duatic zu einer voll drehmomentgeregelten Plattform für Loco-Manipulation. Beide Enden müssen zusammenfinden, bevor ein Roboter wirklich deine Küche aufräumt.
Für dich heisst das vorerst: spannende Machbarkeitsstudie, kein Produkt. Wer HomeBody als Beleg dafür liest, dass Haushaltsroboter 2027 kommen, liest zu viel hinein. Wer es als Signal liest, dass die teuerste Schicht im Robotik-Stack plötzlich wegfallen könnte, liegt näher dran.
OpenAIs GPT-6 Astra hat einen deutschen Heeres-Funkspruch vom 10. Juli 1941 entschlüsselt, der seit 2005 als ungelöst galt. Das Modell suchte sich das Ziel selbst aus und schrieb Enigma-Simulator und Enigma-Bombe eigenständig in Python und C++. Dieselbe Autonomie ist der Grund, weshalb OpenAI seine leistungsfähigsten Modelle gerade gestoppt hat.