🗡️ WEAPONS GUIDE — COMPLETE EDITION

AI開発ワークフロー最大化のための
『武器』図鑑(完全版)

情報収集→保存→検索→分析→出力→評価→自動化 の7ステップ完全網羅

現代のAI開発(特にLLMアプリケーション開発)における「情報収集→ためる→選ぶ→分析・洞察→アウトプット→レビュー→修正」という黄金のパイプラインを自動化・最大化するための、必須ツールと概念の完全版まとめです。

🗡️ 第一部:基本編(標準装備)

1. 情報収集(Gathering)

世界中のデータを、AIが読める状態にして持ってくるフェーズ

RSS / Atom

Webサイトの更新通知技術。純粋なテキスト情報が得られ、入力源として最強かつ最速

FireCrawl / Crawl4AI

AI開発に特化したWebスクレイピングツール。HTMLのゴミを取り除き「きれいなMarkdown」に変換

Playwright / Selenium

ブラウザ自動操作ツール。ログインが必要なサイトや動的サイトから情報を抽出

Serper / Tavily

AIエージェント専用の検索API。AIが自ら検索し、最新情報を取得(Search Grounding)

Unstructured

非構造化データ(PDF, パワポ等)を扱うライブラリ。表や画像も含めてテキスト化

2. ためる(Storage & Structure)

集めたデータを、後で検索・分析しやすい形で保存するフェーズ

Vector Database (Pinecone / ChromaDB / Qdrant)

テキストを「意味のベクトル」として保存するRAGの心臓部

DuckDB / Parquet

超高速な分析用DBと高効率なファイル形式。大量データをPythonで爆速処理

JSONL (JSON Lines)

1行に1つのJSONデータが入ったファイル形式。学習データやログの業界標準

3. 選ぶ(Retrieval & Selection)

大量のデータから、AIに渡すべき「最適な情報」だけを抜き出すフェーズ

RAG (Retrieval-Augmented Generation)

外部知識を検索してAIに渡す仕組み

Hybrid Search (BM25 + Vector)

「キーワード検索」と「意味検索」を混ぜる技術

Cohere Rerank

検索結果を「AIにとっての関連度順」に並べ替える技術。回答精度が劇的に向上

GraphRAG

知識をネットワーク図として扱う技術。隠れた関係性をAIに理解させる

4. 分析・洞察(Analysis & Reasoning)

選んだ情報を元に、AIが思考・計算・推論を行うフェーズ

LangChain / LlamaIndex

AIアプリ開発のオーケストレーション・フレームワーク

DSPy

プロンプトを「プログラムして最適化する」フレームワーク

LangGraph / CrewAI

マルチエージェント構築ツール。複数のAIに役割分担させる

Pandas / Polars

データ分析ライブラリ。AI自身に正確な数値計算や統計処理を行わせる

5. アウトプット(Generation & UI)

結果を人間やシステムが使いやすい形にするフェーズ

Jinja2

Pythonのテンプレートエンジン。プロンプト管理の要

Pydantic / Instructor

データの「型」を定義・検証するライブラリ。出力形式の強制に必須

Markdown

軽量マークアップ言語。LLMが最も得意とする出力形式

Streamlit

PythonだけでWebアプリが作れるツール

6. レビュー(Evaluation)

AIのアウトプットが正しいか評価するフェーズ

Ragas

RAGの精度を数値化して評価するツール

LangSmith / Weights & Biases

AIの実行ログ(トレース)管理ツール。デバッグに使用

7. 修正・自動化(Refinement & Ops)

フロー全体を改善し、自動で回るようにするフェーズ

YAML / TOML

設定ファイル形式。プロンプトやモデル設定をコードから分離

Airflow / n8n

ワークフロー管理ツール。一連の流れをスケジュール実行

🚀 第二部:拡張編(玄人向けアーセナル)

1. 情報収集(Gathering)

テキスト以外の「難易度の高いデータ」や「質の高い情報」を狙い撃ちする

Exa (旧 Metaphor)

LLM用検索エンジン。AIが学習・引用するのに適した質の高いデータだけを探せる

LlamaParse

複雑なPDFをAI用に解析する最強ツール。表や段組みを完璧なMarkdownに変換

MCP (Model Context Protocol)

AIと外部ツール(Slack, GitHub等)を繋ぐ世界共通規格

Apify

スクレイピングロボットのマーケットプレイス。自作だとブロックされるサイトに有効

2. ためる(Storage & Structure)

データの「関係性」や「鮮度」を管理する

Supabase (PostgreSQL + pgvector)

DB、認証、API生成が全部入り。RDBとベクトル検索を一つで完結

Neo4j

グラフデータベース。複雑な人間関係や因果関係をAIに推理させる

Redis

超高速なメモリ内データストア。AIの「短期記憶(会話履歴)」に使用

3. 選ぶ(Retrieval & Selection)

検索漏れを防ぎ、AIに「文脈」を渡す

HyDE (Hypothetical Document Embeddings)

「架空の完璧な回答」を先に作らせて近い記事を探す検索手法

Voyage AI

検索用ベクトル化モデルの特化型ベンダー。専門分野で精度が段違い

Splade

キーワード検索とベクトル検索のいいとこ取り(疎ベクトル)

4. 分析・洞察(Analysis & Reasoning)

コスト管理と、より高度な自律動作

LiteLLM

全てのLLM APIを統一された書き方で使える中継ライブラリ。モデル切り替え・コスト削減が容易

Ollama

自分のPCで高性能LLMを動かすツール。機密情報処理に最適

E2B

AIが書いたプログラムを安全に実行するためのサンドボックスクラウド

5. アウトプット(Generation & UI)

見た目と使い勝手をプロ仕様にする

Chainlit

リッチなチャット画面が作れるライブラリ。思考プロセスの表示などに特化

FastAPI

PythonでWeb APIを作る標準フレームワーク。爆速で動きドキュメントも自動生成

Mermaid.js

テキストを書くだけで図が描けるツール。業務フロー図などを自動生成

6. レビュー(Evaluation)

感覚値ではなく、数値で品質を保証する

Promptfoo

プロンプトの品質をテストするツール。変更時のデグレを防ぐ

Langfuse / Arize Phoenix

AIアプリの挙動を記録・可視化(オブザーバビリティ)

7. 修正・自動化(Refinement & Ops)

環境構築の泥沼から抜け出す

uv

超高速なPythonパッケージ管理ツール。ライブラリインストールのストレスを解消

Docker

アプリが動く環境ごと箱詰めにする技術。環境依存のバグを防ぐ

💡 必殺コンボ(アーキテクチャ例)

A. 完全自動・リサーチ&図解レポート生成機

  1. Exa で質の高い技術記事を検索
  2. LiteLLM 経由で LLM に分析させる
  3. E2B の安全な環境内でPythonコードを実行しグラフを作成
  4. Mermaid.js で相関図を描画
  5. 全体を Markdown レポートにし、Chainlit のUIで出力・ダウンロード

B. ローカル完結・社外秘文書の特化型AI

  1. 社内PDFを LlamaParse で構造化して読み込み
  2. Supabase (Self-hosted) にベクトル保存
  3. Ollama でローカルPC内で回答生成(外部通信ゼロ)
  4. UIは Chainlit で作成
  5. 全てを Docker に入れてネット遮断環境で稼働