Przejdź do treści
CLIPSZTUCZNA INTELIGENCJA
Künstliche IntelligenzModelle, ihr Betrieb und ihre Grenzen

CLIP

Contrastive Language-Image Pre-training

Ein Modell, das auf Hunderten von Millionen Bild-Text-Paaren trainiert wurde. Es platziert Bilder und Texte in einem gemeinsamen numerischen Raum, sodass es bewerten kann, wie gut ein bestimmter Text zu einem bestimmten Bild passt.

Warum das wichtig ist

Dank CLIP verstehen Bildgeneratoren visuelle Beschreibungen wie „warmes Licht“, „kleine Schärfentiefe“ oder „Aufnahme von oben“. Derselbe Mechanismus ermöglicht die Bildsuche mittels natürlicher Sprache anstelle von Schlüsselwörtern.

Was ohne das fehlt

Ohne solche Modelle müsste eine Szenebeschreibung auf eine starre Liste von Etiketten reduziert werden, und Generatoren reagierten nur auf einfache Substantive.

Wann es verwendet wird

In jedem Bildgenerator, in visuellen Suchmaschinen und bei der automatischen Bildbeschreibung in Medienbibliotheken.

Wie wir es einsetzen

CLIP versteht gut das Aussehen, aber schlecht die Syntax. Die Sätze „Frau hält Bericht“ und „Bericht hält Frau“ werden fast gleich wahrgenommen – für die Beachtung der Beziehungen zwischen Objekten sind sprachliche Encoder zuständig.

Zahlen, die man kennen sollte

Künstliche Intelligenz in Zahlen

26%

Prognozowany udział w pełni elektrycznych pojazdów (BEV, bez hybryd) w europejskim parku samochodowym do 2035 roku, w porównaniu z 4% w 2025 r.

BCG2035Europa

88%

Meta podaje, że ponad 88% z 137 000 usuniętych reklam oszukańczych w Polsce zostało wykrytych automatycznie przed zgłoszeniem.

Meta09/2026Polen

2 500 000 000 000 USD

Prognozowane światowe wydatki na AI w 2026 roku.

Gartner2026weltweit

Zahlen aus demselben Feld — gesammelt in unserer Marktdatenbank.

Verwandte Begriffe