Przejdź do treści

Mediarun用語集

人工知能

モデル、その運用と限界

このカテゴリの用語:20件

AI人間の思考、学習、知覚、またはコンテンツ生成を通常必要とするタスクを実行する方法やシステムの集合。HEXX AI CMSでは、言語モデル、文書分析、自動化を含む。ASR音声認識システムの技術的な名称。実際にはSTTと頻繁に交換して使用される。ASRは音声データを分析し、検索可能なテキストやさらなる処理に使える転記を生成する。CLIP数億組の画像とキャプションのペアで学習されたモデル。画像とテキストを同一の数値空間に配置するため、特定の画像にどの程度特定の説明文が適合するかを評価できる。DIFFUSERS拡散モデル(ノイズを段階的に除去して画像を生成するモデル)を実行するためのオープンソースライブラリ。異なる製造元のモデルに対しても統一された処理方法を提供する。FLUXStable Diffusionの開発チームが手がける画像生成モデルのファミリー。schnellバージョンは高速化されており、4ステップで1枚の画像を生成する。GGUFモデルの保存形式で、重みが量子化されており、精度を下げて記録される。たとえば16ビットではなく4ビットで記録される。モデルのサイズは数倍小さくなり、品質の低下はわずかである。KIMI中国のMoonshot AIが開発した言語モデルで、非常に長い文脈を処理できることが特徴。一度に数百ページに相当するテキストを入力可能。LLAMAMeta社が開発したオープンソースの言語モデルのファミリー。2023年に重みの公開が行われ、大手企業以外では手に入らなかった基盤を提供することで、オープンモデルの波を引き起こした。LLM大量のテキストデータを学習したAIモデルで、自然言語を理解し生成する能力を持つ。要約、翻訳、執筆、分類、プログラミング支援などのタスクを実行可能。MLOps機械学習モデルの再現可能な展開、バージョン管理、モニタリング、保守を実現する一連の実践。データ、モデル、インフラ、および生産環境でのパフォーマンス品質の管理を統合する。NLPAIの分野の一つで、人間の言語の分析、理解、生成を行う。データの分類、抽出、感情分析、翻訳、検索、言語モデルなどを含む。OCR画像、スキャン、PDF文書などからテキストを読み取る技術。OCRは視覚的なコンテンツを検索可能、コピー可能、分類可能、AIモデルによる分析可能なテキストに変換する。QWENアリババクラウドが提供するオープンなモデルファミリーで、言語モデルおよび画像モデルを含む。Qwen-Imageはテキストの説明から画像を生成し、画像内にテキストを正しく描画できる数少ないモデルの一つである。RAGAIのパターンの一つで、LLMが回答する前に、外部の知識ベースから重要なデータを検索する。検索された断片はモデルのコンテキストに取り込まれ、企業の情報源から逸脱した回答を抑制する。SDXLStability AIが開発した画像生成モデルで、長年にわたりオープンソースのAIグラフィック分野の基本的なツールとして使われてきた。モデルは約35億のパラメータを持ち、コミュニティによって多数の追加機能が開発されている。STT録音されたまたはリアルタイムの音声をテキストに変換する技術。言語、句読点、タイムスタンプの認識が可能で、場合によっては複数話者の発言を分離することもできる。TRANSFORMER今日、ほぼすべての大きなモデル(言語モデル、画像モデル、音声モデルなど)の基盤となっているニューラルネットワークのアーキテクチャ。その中心となるのは「注意機構」で、モデルは各部分を処理する際に、同時にすべての他の部分を参照し、どれが重要かを自動で判断する。TTSテキストを合成音声に変換する技術。TTSモデルは言語、発音、テンポ、イントネーション、スタイルを調整でき、一部のケースではサンプル音声から声を克隆することも可能である。エンコーダー人間が理解できるデータ(文章、画像、音声など)を、その意味を表す数値の列に変換するモデルの一部。モデルは単語ではなく、これらの数値に基づいて動作する。サンプリングステップ画像生成器がランダムな初期点から徐々にノイズを除去し、完成した画像を得るまでの繰り返し回数。各ステップはモデルの1回の完全な計算を意味する。

← 用語集のすべてのカテゴリ