LLM入門

このページでは、AI技術に関心のある方のために、LLM(大規模言語モデル)の基礎から応用までをわかりやすく解説します。


合計 4 件の記事があります。 | 現在 1 ページ中の 1 ページ目です。

第2章 — インテリジェント文書パース

LLM Primer III ウォークスルー第2回。PDF はテキストファイルではなく、レイアウト指定書である。素朴な変換が何を捨て、レイアウト認識パーサーは何を取り戻すのか。LlamaParse、Docling、Unstructured、Marker-PDF、Firecrawl、DeepSeek-OCR の現在地と、ページ画像を直接検索するマルチモーダル系の道筋を整理します。

2026-03-19

第1章 — RAGアーキテクチャの進化

LLM Primer III ウォークスルー第1回。ベースモデルの2つの構造的制約 — 凍結された知識と、出典が示せないこと — に対するアーキテクチャ上の単一の答えが、3年で4つの顔を持つに至った話です。Naive、Advanced、Modular、Agentic という4つの姿勢と、検索よりもファインチューニングが効く場面を整理します。

2026-03-18

7.3 マルチモーダルモデルとLLMの統合 | テキスト、画像、音声、映像の融合技術

マルチモーダルモデルとLLMの統合により、テキスト、画像、音声、映像を同時に処理することで、より深い理解と高精度な応答が可能になります。具体的な技術と応用例を紹介します。

2024-11-26

7.3 LLMとマルチモーダルモデルの統合 | 画像、音声、映像との連携による未来のAI

LLM(大規模言語モデル)とマルチモーダルモデルの統合について解説。テキスト以外のデータ(画像、音声、映像など)との連携により、AIシステムの認識能力が飛躍的に向上する具体的な応用例や技術的課題、未来の展望を紹介。

2024-09-30