Multimodale KI

Auch: Multimodalität · Multimodal

Multimodale KI kann mehr als nur eine Art von Daten verarbeiten. Während ein reines Sprachmodell nur Text versteht, kann ein multimodales Modell gleichzeitig mit Text, Bildern, Audio oder Video umgehen. Du kannst ihm also etwa ein Foto zeigen und eine Frage dazu stellen oder ein Diagramm erklären lassen.

Möglich wird das, weil das Modell gelernt hat, verschiedene Datentypen in einer gemeinsamen «Sprache» aus Zahlen darzustellen und miteinander zu verknüpfen. In der Praxis eröffnet das viele Anwendungen: Rechnungen aus Fotos auslesen, Grafiken interpretieren, gesprochene Sprache verstehen oder Bilder beschreiben. Die meisten führenden KI-Assistenten sind heute multimodal. Multimodalität gilt als wichtiger Schritt zu KI, die die Welt ähnlicher wahrnimmt wie ein Mensch, der ebenfalls sieht, hört und liest.