Przejdź do treści

Mediarun-Glossar

Künstliche Intelligenz

Modelle, ihr Betrieb und ihre Grenzen

20 Begriffe in diesem Bereich

ABTASTSCHRITTEAnzahl der Schritte, in denen der Bildgenerator schrittweise Rauschen aus einem zufälligen Ausgangspunkt entfernt, bis das Bild fertig ist. Jeder Schritt entspricht einer vollständigen Berechnung des Modells.ASRTechnischer Begriff für Systeme der automatisierten Spracherkennung; in der Praxis oft synonym mit STT verwendet. ASR analysiert Audio und erzeugt eine durchsuchbare Transkription oder ermöglicht weitere Verarbeitung.CLIPEin Modell, das auf Hunderten von Millionen Bild-Text-Paaren trainiert wurde. Es platziert Bilder und Texte in einem gemeinsamen numerischen Raum, sodass es bewerten kann, wie gut ein bestimmter Text zu einem bestimmten DIFFUSERSEine offene Bibliothek zur Ausführung von Diffusionsmodellen – Modellen, die Bilder durch schrittweises Entfernen von Rauschen erzeugen. Sie bietet eine einheitliche Schnittstelle für Modelle verschiedener Hersteller.ENKODERTeil des Modells, der menschenverständliche Daten – wie einen Satz, ein Bild oder ein Video – in eine Zahlenfolge umwandelt, die deren Bedeutung beschreibt. Das Modell arbeitet nicht mit Wörtern, sondern mit diesen ZahleFLUXFamilie von Bildgenerierungsmodellen vom Team, das zuvor Stable Diffusion entwickelt hat. Die Variante schnell ist beschleunigt und zeichnet ein Bild in vier Schritten.GGUFEin Modellformat, bei dem die Gewichte quantisiert sind – also mit geringerer Genauigkeit gespeichert, beispielsweise mit vier statt sechzehn Bit. Das Modell wird mehrfach kleiner, die Qualität sinkt leicht.KIEine Sammlung von Methoden und Systemen, die Aufgaben ausführen, die normalerweise menschliches Denken, Lernen, Wahrnehmung oder Inhaltsgenerierung erfordern. Im HEXX AI CMS umfasst dies Sprachmodelle, Dokumentenanalyse KIMISprachmodell des chinesischen Unternehmens Moonshot AI, bekannt für die Verarbeitung sehr langer Kontexte – kann gleichzeitig Textmaterial verarbeiten, das mehreren hundert Seiten entspricht.LLAMAFamilie offener Sprachmodelle von Meta. Die Veröffentlichung der Gewichte im Jahr 2023 löste eine ganze Welle offener Modelle aus, da sie einen Ausgangspunkt schuf, der zuvor nur großen Unternehmen zugänglich war.LLMEin KI-Modell, das auf großen Textmengen trainiert wird und in der Lage ist, natürliche Sprache zu verstehen und zu generieren. Es führt unter anderem Aufgaben wie Zusammenfassen, Übersetzen, Schreiben, Klassifizieren unMLOpsEin Satz von Praktiken, der ein wiederholbares Bereitstellen, Versionieren, Überwachen und Warten von Machine-Learning-Modellen gewährleistet. Er verbindet Arbeit mit Daten, Modellen, Infrastruktur und der Qualität der pNLPEin Bereich der KI, der sich mit der Analyse, dem Verständnis und der Generierung menschlicher Sprache befasst. Enthält Klassifikation, Datenextraktion, Sentimentanalyse, Übersetzung, Suchfunktionen und Sprachmodelle.OCRTechnologie, die Text aus Bildern, Scans und PDF-Dokumenten extrahiert. OCR wandelt visuelle Inhalte in suchbaren, kopierbaren, klassifizierbaren und für KI-Modelle analysierbaren Text um.QWENFamilie offener Modelle des chinesischen Alibaba Cloud, die sprachliche und bildbasierte Modelle umfasst. Die Version Qwen-Image erzeugt Grafiken aus Beschreibungen und ist eine der wenigen, die Texte auf Bildern korrektRAGEin AI-Muster, bei dem ein LLM vor der Antwort relevante Daten in einer externen Wissensdatenbank sucht. Die gefundenen Ausschnitte gelangen in den Kontext des Modells, was Antworten vermeidet, die von UnternehmensquelleSDXLBildgenerator von Stability AI, jahrelang das grundlegende Werkzeug der offenen KI-Grafikszene. Der Modell besitzt etwa 3,5 Milliarden Parameter und eine enorme Anzahl an von der Community erstellten Erweiterungen.STTTechnologie, die gesprochene oder laufende Sprache in Text umwandeln. Sie können Sprache, Satzzeichen, Zeitstempel erkennen und manchmal auch die Äußerungen verschiedener Sprecher trennen.TRANSFORMERAufbau eines neuronalen Netzwerks, auf dem heute praktisch jeder große Modell – sprachlich, bildlich oder akustisch – basiert. Sein Kern ist der Aufmerksamkeitsmechanismus: Der Modell betrachtet bei der Verarbeitung jedeTTSTechnologie, die Text in synthetische Sprachausgabe umwandeln. TTS-Modelle können Sprache, Aussprache, Tempo, Intonation, Stil und in einigen Fällen auch die Stimme aus einer Probe nachbilden.

← Alle Glossar-Bereiche