Zum Inhalt springen
/ Home / Glossar / KI / Was ist Inference? KI-Glossar einfach erklärt · OIT

Was ist Inference? KI-Glossar einfach erklärt · OIT

Inference (deutsch „Inferenz“) bezeichnet die produktive Ausführung eines bereits trainierten KI-Modells – also den Moment, in dem eine Anfrage in eine Antwort übersetzt wird. Im Unterschied zum Training, das einmalig und rechenintensiv ist, läuft Inference millionenfach pro Tag und bestimmt die operativen Kosten einer KI-Anwendung.

Was bedeutet Inference in der KI?

Beim maschinellen Lernen durchläuft ein Modell zwei Phasen: das Training, in dem es aus großen Datenmengen Muster lernt, und die Inference, in der es dieses Gelernte auf neue, unbekannte Eingaben anwendet. Jede Antwort eines Chatbots, jede Bilderkennung und jede Übersetzung ist ein Inference-Vorgang.

Training vs. Inference – der Unterschied

  • Training: einmalig, extrem rechenintensiv, erzeugt das Modell.
  • Inference: dauerhaft im Betrieb, pro Anfrage günstiger, in Summe aber der größte Kostenblock.

Vereinfacht: Training baut das Modell, Inference lässt es arbeiten.

Wie läuft Inference ab?

Die Eingabe (Prompt) wird in Tokens zerlegt, durch das neuronale Netz geleitet und Token für Token zu einer Antwort zusammengesetzt. Entscheidend sind dabei Latenz (wie schnell kommt die Antwort) und Durchsatz (wie viele Anfragen parallel möglich sind).

Was kostet Inference – und wie senkt man die Kosten?

Inference-Optimierung – etwa durch Quantization, Speculative Decoding, Batching oder Caching – kann die Kosten um bis zu 80 % senken und die Latenz deutlich reduzieren. Gerade bei hohem Anfragevolumen lohnt sich die Optimierung schnell.

Welche Hardware & Runtimes kommen zum Einsatz?

Inference läuft auf GPUs oder spezialisierten Beschleunigern. Für das Self-Hosting kommen Runtimes wie vLLM, TGI (Hugging Face), Ollama oder llama.cpp zum Einsatz – je nach Modellgröße, Datenschutzanforderung und Budget.

Häufige Fragen zu Inference

Was ist der Unterschied zwischen Training und Inference?

Training erzeugt das Modell aus Daten, Inference wendet das fertige Modell auf neue Anfragen an.

Warum ist Inference so kostenrelevant?

Weil sie im Dauerbetrieb millionenfach ausgeführt wird – über die Zeit übersteigen die Inference-Kosten meist die einmaligen Trainingskosten.

Bei produktiven KI-Anwendungen mit klaren SLA- und Kostenzielen begleiten wir den Aufbau im Rahmen unserer KI-Dienstleistungen.