Inferenz

Auch: Inference

Inferenz bezeichnet den Moment, in dem ein fertig trainiertes KI-Modell tatsächlich genutzt wird, um eine Ausgabe zu erzeugen. Wenn du eine Frage stellst und eine Antwort bekommst, findet Inferenz statt. Man unterscheidet damit zwischen Training – dem einmaligen, aufwendigen Lernen – und Inferenz, dem laufenden Anwenden des Gelernten.

Inferenz braucht Rechenleistung, meist auf spezialisierten Chips wie GPUs. Bei populären Diensten summiert sich das über Millionen von Anfragen zu erheblichen Kosten und Energieverbrauch. Deshalb arbeiten Anbieter intensiv daran, Inferenz schneller und günstiger zu machen, etwa durch effizientere Modelle oder Bauweisen wie Mixture of Experts. Für dich zeigt sich Inferenz vor allem in einem: wie schnell die Antwort erscheint und wie viel die Nutzung kostet.

VERWANDTE BEGRIFFE