Słownik Mediarun
Sztuczna inteligencja
Modele, ich obsługa i granice
20 haseł w tym dziale
AIZbiór metod i systemów wykonujących zadania zwykle wymagające ludzkiego rozumowania, uczenia się, percepcji lub generowania treści. W HEXX AI CMS obejmuje modele językowe, analizę dokumentów i automatyzacje.ASRTechniczna nazwa systemów automatycznego rozpoznawania mowy; w praktyce często używana zamiennie ze STT. ASR analizuje audio i generuje transkrypcję możliwą do wyszukiwania lub dalszego przetwarzania.CLIPModel nauczony na setkach milionów par zdjęcie plus podpis. Umieszcza obrazy i teksty w jednej przestrzeni liczbowej, więc potrafi ocenić, jak bardzo dany opis pasuje do danego obrazu.DIFFUSERSOtwarta biblioteka do uruchamiania modeli dyfuzyjnych — tych, które tworzą obraz przez stopniowe usuwanie szumu. Daje jeden sposób obsługi dla modeli różnych producentów.ENKODERCzęść modelu, która zamienia dane zrozumiałe dla człowieka — zdanie, zdjęcie, nagranie — na ciąg liczb opisujący ich znaczenie. Model nie pracuje na słowach, tylko na tych liczbach.FLUXRodzina modeli do generowania obrazów od zespołu, który wcześniej stworzył Stable Diffusion. Wariant schnell jest przyspieszony i rysuje kadr w czterech krokach.GGUFFormat zapisu modelu, w którym wagi są skwantowane — zapisane z mniejszą precyzją, na przykład czterema bitami zamiast szesnastoma. Model chudnie kilkukrotnie, jakość spada nieznacznie.KIMIModel językowy chińskiego Moonshot AI, znany z obsługi bardzo długiego kontekstu — potrafi przyjąć naraz materiał odpowiadający kilkuset stronom tekstu.KROKI PRÓBKOWANIALiczba przejść, w których generator obrazu stopniowo usuwa szum z losowego punktu wyjścia, aż zostanie gotowa grafika. Każdy krok to jedno pełne przeliczenie modelu.LLAMARodzina otwartych modeli językowych Meta. Udostępnienie wag w 2023 roku uruchomiło całą falę modeli otwartych, bo dało punkt wyjścia niedostępny wcześniej poza wielkimi firmami.LLMModel AI uczony na dużych zbiorach tekstu, zdolny rozumieć i tworzyć język naturalny. Wykonuje m.in. streszczanie, tłumaczenie, pisanie, klasyfikację oraz pomoc programistyczną.MLOpsZestaw praktyk zapewniających powtarzalne wdrażanie, wersjonowanie, monitorowanie i utrzymanie modeli uczenia maszynowego. Łączy pracę nad danymi, modelami, infrastrukturą oraz jakością działania produkcyjnego.NLPDziedzina AI zajmująca się analizą, rozumieniem i generowaniem języka ludzkiego. Obejmuje klasyfikację, ekstrakcję danych, analizę sentymentu, tłumaczenie, wyszukiwanie i modele językowe.OCRTechnologia odczytująca tekst z obrazów, skanów i dokumentów PDF. OCR przekształca treść wizualną w tekst możliwy do wyszukiwania, kopiowania, klasyfikowania i analizy przez modele AI.QWENRodzina otwartych modeli chińskiego Alibaba Cloud, obejmująca modele językowe i obrazowe. Wersja Qwen-Image tworzy grafikę z opisu i jako jedna z nielicznych poprawnie rysuje napisy na obrazie.RAGWzorzec AI, w którym przed odpowiedzią LLM wyszukuje istotne dane w zewnętrznej bazie wiedzy. Znalezione fragmenty trafiają do kontekstu modelu, co ogranicza odpowiedzi oderwane od firmowych źródeł.SDXLGenerator obrazów Stability AI, przez lata podstawowe narzędzie otwartego świata grafiki AI. Model ma około 3,5 miliarda parametrów i ogromną liczbę dodatków tworzonych przez społeczność.STTTechnologia przekształcająca nagraną lub bieżącą mowę na tekst. Może rozpoznawać język, interpunkcję, znaczniki czasu i czasem rozdzielać wypowiedzi różnych mówców.TRANSFORMERBudowa sieci neuronowej, na której opiera się dziś praktycznie każdy duży model — językowy, obrazowy i dźwiękowy. Jej sercem jest mechanizm uwagi: model przy przetwarzaniu każdego fragmentu patrzy jednocześnie na wszystkTTSTechnologia zamieniająca tekst na syntetyczny dźwięk mowy. Modele TTS mogą dobierać język, wymowę, tempo, intonację, styl i w niektórych przypadkach klonować głos z próbki.