AI・機械学習
AI/機械学習
PyTorch・TensorFlow などのライブラリや GPT・Claude などの基盤モデルの比較から、機械学習・ニューラルネット・LLM の考え方まで。まず TL;DR で。
コレクション 01
ライブラリ / フレームワーク(4)
scikit-learn
古典的 ML(非ディープ)
分類・回帰・クラスタリングなど “ディープラーニング以外” の機械学習の定番ライブラリ。手軽で実務的。
TensorFlow
ディープラーニング
本番運用・モバイル・大規模に強い DL フレームワーク。高レベル API の Keras を統合している。
PyTorch
ディープラーニング
動的計算グラフで直感的に書けるディープラーニングのフレームワーク。研究から実装まで事実上の主流。
JAX
数値計算 / 自動微分
NumPy ライクに自動微分・JIT・並列化ができる高性能な数値計算ライブラリ。研究や大規模学習で台頭。
| 項目 | scikit-learn | TensorFlow | PyTorch | JAX |
|---|---|---|---|---|
| 種別 | 古典的 ML(非ディープ) | ディープラーニング | ディープラーニング | 数値計算 / 自動微分 |
| 提供元 | コミュニティ | Meta | ||
| ライセンス | オープンソース(BSD) | オープンソース(Apache 2.0) | オープンソース(BSD) | オープンソース(Apache 2.0) |
| 一番の強み | 古典的 ML が一通り揃う | 本番/モバイル/組込み(TF Lite)に強い | Python ライクでデバッグが容易 | 自動微分+XLA で高速 |
| 主な用途 | 表形式データの予測 | 本番 DL / MLOps | DL の研究・実装 | 研究・大規模学習 |
コレクション 02
基盤モデル(LLM)(4)
GPT(OpenAI)
商用 LLM(クローズド)
OpenAI の大規模言語モデル系列。ChatGPT で広く普及し、API 経由で汎用的な生成・対話・エージェントに使われる。
Claude(Anthropic)
商用 LLM(クローズド)
Anthropic の大規模言語モデル系列。長文の扱いやコーディング、安全性への配慮で知られ、API や Claude で利用する。
Gemini(Google)
商用 LLM(クローズド)
Google の大規模言語モデル系列。テキスト/画像/音声を扱うマルチモーダルと、Google サービス統合が特徴。
Llama(Meta)
オープンウェイト LLM
Meta が“重み(モデル)を配布する”大規模言語モデル系列。自前ホストやファインチューニングができ、オープン LLM の中心。
| 項目 | GPT(OpenAI) | Claude(Anthropic) | Gemini(Google) | Llama(Meta) |
|---|---|---|---|---|
| 種別 | 商用 LLM(クローズド) | 商用 LLM(クローズド) | 商用 LLM(クローズド) | オープンウェイト LLM |
| 提供元 | OpenAI | Anthropic | Meta | |
| ライセンス | プロプライエタリ(API 提供) | プロプライエタリ(API 提供) | プロプライエタリ(API 提供) | オープンウェイト(コミュニティライセンス) |
| 一番の強み | 汎用性・エコシステムが広い | 長いコンテキストの扱い | マルチモーダル | 重みが公開され自前ホスト可 |
| 主な用途 | チャット / 文章生成 | コーディング支援 | マルチモーダル処理 | セルフホスト / オンプレ |
操作して学ぶ
AIモデルの系譜
1958年のパーセプトロンから、誤差逆伝播・CNN・LSTM、Transformerが起こした地殻変動、 拡散モデル、そしてo1やDeepSeek-R1の推論時スケーリングまで。 実線は直接の派生・アーキテクチャ継承、 破線は思想・手法の影響。 ドラッグとズームで探検し、気になるモデルをクリックすると解説が出ます。
ノードをクリックすると、そのOSの解説と関連記事がここに表示されます。
操作して学ぶ
トークナイザ可視化 — なぜ日本語はトークンを食うのか
本物のBPE辞書(GPT-4o系)で分割を色分け表示。英語と日本語のトークン数の差を体感。
操作して学ぶ
Self-Attention可視化 — QKᵀ/√d_kを実際の行列で追う
投影→スコア→スケール→softmax→加重和を実数値で再生。√d_kで割らないと飽和することを実測できる。
操作して学ぶ
デコーディング戦略可視化 — temperature/top-k/top-pとビームサーチ
temperatureで分布の鋭さを、top-k/top-pで候補を操作。ビーム幅を上げると局所最適を脱出できることも実測できる。
解説記事
考え方・概念
機械学習・ニューラルネット・LLM など、ツールの下で動く仕組み。まず TL;DR で。
CNN と RNN
画像なら CNN、時系列や文章なら RNN。データの形でどちらを選ぶかが分かる。畳み込みと再帰それぞれの仕組みと用途、Transformer との関係まで整理。
CNN の畳み込み演算の数理:カーネル・ストライド・受容野
畳み込みを式から開封。なぜパラメータ共有で平行移動に強くなり、層を重ねると受容野が広がるのか、im2col 実装まで原理で腑に落ちます。
DDIMと拡散サンプリングの高速化
拡散モデルの生成が遅い理由を断ち、学習はそのままで数十ステップへ短縮する原理を解説。決定論的サンプリングと確率流ODEの正体までつかめます。
FlashAttention:メモリ効率的なアテンション計算
アテンションが長文で急に遅く重くなる正体は HBM への中間行列の書き戻し。タイル化とオンライン softmax でそれを断てば、計算結果を変えずに速度とメモリを同時に取り戻せる。
GAN の原理:敵対的学習とナッシュ均衡
生成器と識別器を競わせるだけで本物そっくりのデータが生まれる仕組みを、ミニマックス目的・JSダイバージェンス・モード崩壊の数理から正確につかめます。
GQA/MQA:KVキャッシュを削減するアテンション変種
LLM 推論の帯域とメモリを食う KV キャッシュを、Key/Value ヘッドの共有で数分の一に圧縮する。MQA・GQA の原理と品質トレードオフ、MHA からの低コスト変換まで一気に押さえる。
GRPO/RLVRと検証可能報酬による推論強化
価値関数を捨てて学習を軽くし、答え合わせだけで推論力を伸ばす最新手法の原理がわかります。GRPOの群相対優位とRLVRの設計を、PPOとの差分から内部まで理解できます。
k-means・GMMとEMアルゴリズムの収束原理
なぜEMは反復のたびに必ず良くなるのか。混合ガウスの潜在変数モデルからEステップとMステップを導出し、対数尤度が単調増加する仕組みと、k-meansがその特殊例である理由まで腑に落ちます。
KV キャッシュと LLM 推論の最適化
LLM の生成が遅い・GPU メモリを食う原因の多くは KV キャッシュ。その仕組みと見積もり、PagedAttention 等の最適化を押さえれば、推論コストの勘所が一気に見通せる。
LLM と Transformer
LLM は「次に来る単語」をひたすら当てるよう大量の文章で訓練したモデル。その心臓部が、文中のどの語に注目すべきかを動的に重み付けする Transformer のアテンション。
LLM の学習パイプライン:事前学習・SFT・アライメント
なぜ素のモデルは指示に従わないのか。事前学習・SFT・アライメントの3段を、目的・データ・得られる能力で分解すれば、LLM の挙動とコストの勘所が一気に腑に落ちます。
LLMエージェントとツール使用
LLMに検索や計算を外注させれば、パラメータに無い知識でも正確に答えられる。関数呼び出し・ReAct・計画反省ループの仕組みと暴走の防ぎ方を原理から押さえ、堅牢なエージェントを設計できます。
MCMCとサンプリング:メトロポリス・ヘイスティングスとギブス
解けない事後分布の積分も、賢く設計したマルコフ連鎖を歩かせれば近似できます。MH法の受理確率の正体と、HMCやR-hatで「本当に収束したか」を見抜く目が手に入ります。
Mixture of Experts(MoE)とルーティングの内部
パラメータを増やしても計算量を増やさない――その魔法の正体が MoE。疎な活性化とルーティングの原理を押さえれば、巨大モデルが安く速い理由と落とし穴が一気に腑に落ちます。
Mixture-of-Depths(動的計算配分)
全トークンを全層に通すのは無駄――簡単なトークンは層を飛ばせばいい。ルータが層ごとに処理する少数トークンだけを選ぶ Mixture-of-Depths を押さえれば、計算量を固定したまま深さを稼ぐ設計が腑に落ちます。
MLOps
作ったモデルを本番で安定して動かし続けるための考え方と仕組みが MLOps。データやモデルのバージョン管理・監視・再学習を自動化し、開発から運用までを継続的に回す。
Multi-Head Attention と位置エンコーディングの内部
アテンションが「なぜ複数ヘッドなのか」「順序をどう知るのか」を原理から押さえれば、Transformer の挙動と弱点が腑に落ちる。分割・結合と位置表現の核心を一気に整理。
PAC学習とVC次元:学習可能性の理論
なぜ複雑なモデルほど多くのデータを要するのか、その下限を数式で説明できるようになる。VC次元でモデルの表現力を測り、必要サンプル数と汎化誤差の上界を見積もる枠組みを身につけられる。
Q学習とDQN:価値ベース強化学習の内部
TD学習でQ値がなぜ更新できるのか、なぜ深層化すると発散するのかを原理から理解。経験再生・ターゲットネットワーク・Double DQNが何の問題を潰しているかが一本につながります。
RAGの内部:チャンク化・検索・再ランクの設計
RAGの回答品質は検索の質でほぼ決まる。チャンク化・密疎ハイブリッド・再ランクの設計判断を原理から押さえれば、的外れな引用や幻覚の主因を体系的に潰せる。
RLHF と DPO:人間のフィードバックによるアライメント
事前学習だけのモデルを「人に好かれる助手」へ仕上げる核心技術。報酬モデルとPPOで回すRLHFと、選好から直接最適化する軽量なDPOの仕組みと違いを原理から理解できます。
RNN の限界と LSTM・GRU のゲート機構
なぜ素のRNNは長い文脈を忘れるのか。その答えは勾配の繰り返し積にあり、ゲートとセル状態がそれを断ち切ります。長期依存を保つ仕組みを原理から掴めます。
RoPE(回転位置埋め込み)の数理と長文脈外挿
なぜ現行 LLM が位置を「回転」で表すのかを数理から理解できる。内積が相対距離だけに依存する仕組みと、NTK-aware/YaRN による文脈長拡張の効かせ方まで一気に整理。
Self-Attention の計算:QKV とスケーリングの導出
アテンションの中身を式で開封。QKVの内積がなぜ類似度になり、なぜ√d_kで割るのかまで、手を動かして腑に落とせます。
TD学習と適格度トレース(TD(λ))
強化学習の更新を「待たずに・少しずつ」回す仕組みが腑に落ちます。TD誤差からn-step・TD(λ)まで、バイアスと分散をλ一本で調整する設計の理由を最短でつかめます。
Transformer アーキテクチャ全体の構造
アテンションの式だけでなく、残差接続・LayerNorm・FFN・マスクの「積み重ね方」まで一枚で俯瞰でき、各部品がなぜその位置にあるのかを腑に落とせる。
VAE の数理:変分下界(ELBO)と再パラメータ化
計算できない周辺尤度を、なぜ下から押さえて学習できるのか。ELBO の導出と再パラメータ化トリックを順に追い、VAE の損失が再構成と正則化に分かれる理由まで腑に落ちます。
Vision Transformer(ViT)とパッチ埋め込み
画像をパッチ列に変えれば Transformer がそのまま画像に効く理由を、パッチ埋め込み・位置埋め込み・帰納バイアスの欠如・大規模事前学習の必要性まで原理から押さえられる。
word2vec/負例サンプリングの数理
巨大語彙のソフトマックスを避けつつ良い単語ベクトルが学べる理由を、負例サンプリングの導出から押さえます。ユニグラム0.75乗分布の効果と、学習結果が実はPMI行列の暗黙的分解になっているという驚きの解釈まで一気通貫で理解できます。
アテンション変種の系統と計算量マップ
full・疎・線形・GQA/MQA・FlashAttention が乱立して選べない悩みを、計算量・メモリ・品質の三軸で一枚に整理する。各変種が何を犠牲に何を得たかを年代と分岐で押さえ、用途に合う一手を選べるようになる。
アドバンテージ推定(GAE)と分散低減
PPOがなぜ安定して学習できるのか、その心臓部であるGAEをTD誤差の指数加重和として導出します。λひとつでバイアスと分散を連続的に調律する仕組みが腑に落ちます。
アンサンブル蒸留とモデルマージング
再学習なしで複数モデルの強みを1つに束ねたい人へ。重み平均・タスクベクトル演算・SLERP・TIESの原理と、なぜ混ぜて性能が上がるかを線形モード接続から解き、蒸留との違いまで一気に整理する。
インコンテキスト学習はなぜ起きるのか
数例見せるだけでLLMが新タスクを解く謎を、複数仮説で腑に落とす。仕組みを掴めば、プロンプト設計や few-shot 失敗時の打ち手が根拠を持って選べます。
ガウス過程と非パラメトリック回帰
予測値だけでなく不確実性まで閉形式で返すモデルが欲しいなら、ガウス過程が最短解です。カーネルが共分散を決め、事後予測の平均と分散が行列演算だけで求まる原理と、計算量の壁を越える疎近似まで一気に掴めます。
カリキュラム学習とデータ順序の効果
学習データを見せる順番を変えるだけで、収束が速まりノイズへの耐性も上がる。易→難の段階提示や自己ペース学習、事前学習の混合比設計まで、データ順序を武器にする原理を押さえられます。
グラフニューラルネットワークとメッセージパッシング
ソーシャルグラフや分子・知識グラフをそのまま学習に乗せたいなら鍵は近傍集約。メッセージパッシングの原理から、GCN・GAT・GraphSAGEの違い、過平滑化とWL検定が示す表現力の限界までを通して解く。
グロッキング(Grokking)と遅延汎化の謎
訓練精度が100%に張り付いた後で突然テスト精度が跳ね上がる謎を、重み減衰・回路形成・暗記から汎化への相転移として読み解く。なぜ汎化が遅れて訪れるかが腑に落ちる。
サポートベクターマシンとカーネルトリックの数理
なぜSVMは少数のデータ点だけで決まり、非線形分類を内積一発でこなせるのか。最大マージン・双対問題・カーネルの正体を一本の筋で導き、Cやγの意味まで腑に落とします。
スケーリング則(Chinchilla 則)とモデル設計
同じ計算予算でも、パラメータとデータの配り方ひとつで損失は大きく変わる。Chinchilla 則を押さえれば、無駄に巨大化させず最小コストで最良のモデル設計に踏み込めます。
スコアベース生成モデルとスコアマッチング
確率密度そのものを諦め、対数尤度の勾配だけを当てれば生成できる。スコアマッチングとLangevin動力学の原理から、拡散モデルと同じSDEへ行き着く道筋がつかめます。
スパースオートエンコーダによる解釈
LLMの中間活性を単義的な特徴へ分解できる。重ね合わせを疎な辞書でほどくSAEの原理と学習の勘所、特徴ステアリングによる因果検証まで実装目線で押さえる。
ディープラーニング
ニューラルネットの層を深く重ね、特徴量づくりまで自動で学習させる機械学習の一分野。画像・音声・言語で精度が一気に伸び、今のAIブームの土台になった。
データ拡張
学習データが足りなくても、回転や反転で水増しして精度を底上げ。データ拡張で多様性を増やし、過学習を抑えて未知データへの汎化性能を高める手法を解説。
デコーディング戦略:貪欲法・ビームサーチ・サンプリング
LLM の出力が硬すぎる・壊れる・繰り返すのは、モデルではなくデコーディング設定が原因のことが多い。貪欲法からtop-pまで仕組みで選び分けられます。
テスト時適応とドメインシフトへの対処
学習時と本番でデータ分布がずれると精度は静かに崩れる。BN統計更新・TENT・自己訓練・重要度重み付けの原理を押さえれば、再学習なしでテスト分布へ追従し、劣化を最小化できます。
トークナイザのアルゴリズム:BPE・WordPiece・Unigram
語彙の決め方ひとつでトークン数も未知語耐性も変わる。BPE・WordPiece・Unigram の分割原理を比較し、なぜそのサブワードになるかを仕組みで理解できます。
トークン化(トークナイザ)
LLMの入力上限や課金が読めるようになる。テキストをトークンという小さな単位に分割する処理を解説し、なぜトークン単位で数えるのかを理解。
ドロップアウトの理論:アンサンブルとベイズ近似
ドロップアウトを「ランダムに枝を切る雑な正則化」で終わらせず、指数個の部分網の暗黙アンサンブルとして捉え直すと、なぜ効くかが腑に落ちる。推論時のスケーリングとMC Dropoutによる不確実性推定まで一気通貫で押さえられる。
ナイーブベイズと生成的分類器の原理
条件付き独立という大胆な仮定がなぜ実用で壊れにくいのか。事後確率の組み立てとラプラススムージング、識別モデルとの使い分けを原理から押さえれば、少データ・高次元での第一選択に確信が持てます。
ニューラルタンジェントカーネル(NTK)と無限幅理論
なぜ非凸なはずのニューラルネットが勾配降下で学習できるのか。無限幅極限でネットがカーネル回帰に化けるNTK理論を押さえれば、収束・汎化・特徴学習の謎に原理から踏み込めます。
ニューラルネットワーク
脳のニューロンを“ざっくり”模した計算の仕組み。入力に重みを掛けて足し、活性化関数で曲げる――を層で積み重ね、誤差から重みを少しずつ直して学習する。
パープレキシティと言語モデルの評価
パープレキシティが低いのに賢くない、別モデルと数値が比べられない——その違和感は交差エントロピーとトークナイザ依存性から説明できます。指標の正体を数理で押さえれば、評価の落とし穴を踏まずに済みます。
バイアス-バリアンス分解と二重降下現象
汎化誤差をバイアス・バリアンス・ノイズに分解すれば、過学習の正体が腑に落ちる。さらに過剰パラメータ域で誤差が再び下がる二重降下まで押さえれば、大規模モデルが成り立つ理由まで見通せる。
バイアス・分散とブースティング/バギングの統一視点
ブースティングとバギングは別物に見えて、誤差分解の同じ枠で対比できる。バギングは分散、ブースティングはバイアスを削るという軸で整理すれば、どの手法をいつ選ぶかに理屈が通ります。
パイプライン並列とマイクロバッチスケジューリング
層をステージに割ると待ち時間(バブル)が生まれる理由と、GPipe/1F1Bのマイクロバッチ刻みでそれを薄める原理、メモリと通信のトレードオフ、3D並列での組み込み方が一本でつながる。
バッチサイズと学習率のスケーリング則
バッチを増やしても精度が落ちる原因が腑に落ちる。線形/平方根スケーリングと勾配ノイズスケールで学習率の合わせ方を理屈から決め、臨界バッチサイズとLARS/LAMBまで一本で押さえる。
バッチ正規化の理論:内部共変量シフト論争
BatchNormが速い真因は内部共変量シフトの抑制ではなく損失地形の平滑化だった。この視点で小バッチ崩壊やLayerNorm/GroupNormへの乗り換え判断まで原理から見通せる。
パラメータ効率ファインチューニング:LoRA と QLoRA
巨大モデルを丸ごと再学習せず、追加した小さな行列だけ動かす。LoRA なら学習対象を1%未満に、QLoRA なら家庭用GPU1枚でも数十Bモデルを微調整できる。
ファインチューニングと RAG
基盤モデルを自分の用途に合わせる2つの道。内部を追加学習で書き換える「ファインチューニング」と、外部知識を検索して渡す「RAG」。向き不向きとコストで使い分ける。
フローマッチングと連続正規化フロー
拡散モデルの遠回りなノイズ過程を捨て、まっすぐな輸送を回帰で学べる。条件付きフローマッチングの原理と直線的輸送の利点をつかめば、少ステップ生成の正体が見えます。
プロセス報酬モデルと推論時スケーリング
学習を増やさず「考える時間」を増やして賢くする手法の原理がわかります。ステップ単位で採点するPRMと検証器による解探索、o1系が推論時計算で精度を伸ばす仕組みを内部から理解できます。
プロンプトエンジニアリング
LLM から狙った出力を引き出すための“指示の設計”。明確な指示・役割・例示・段階的に考えさせる工夫で、同じモデルでも結果が大きく変わる。
ベクトルデータベース
キーワード一致では拾えない意味の近さで検索できる。埋め込み(高次元ベクトル)の近傍検索に特化したデータベースで、RAGの基盤になる仕組みを解説。
マルチモーダル融合:CLIP・視覚言語モデルの内部
画像とテキストを同じ意味空間で扱える理由が腑に落ちる。CLIPの共有埋め込みから、ビジョンエンコーダとLLMを繋ぐ投影層・Q-Former、融合方式までを内部から解説します。
モデルキャリブレーションと不確実性推定
現代DNNの確信度はあてになりません。なぜ過信が起きるかを示し、ECE・温度スケーリング・共形予測で確率を信頼できる値に直し、二種類の不確実性を切り分ける方法をまとめます。
モデルベース強化学習と世界モデル
環境の遷移と報酬を学んで頭の中でシミュレーションすれば、少ない実経験で計画できる。Dyna・MCTS・Dreamerの原理と、サンプル効率と引き換えの複合誤差まで一気に押さえる。
モデル評価(精度・適合率・再現率)
分類モデルの良し悪しは正解率だけでは測れません。混同行列をもとにした適合率・再現率・F1値の意味と、不均衡データでの落とし穴を整理します。
ラベル平滑化と正則化テクニックの数理
正解確率を1から少し引くだけで過信が和らぎ較正が改善します。なぜ効くのかをロジット間マージン・クラス表現の幾何・蒸留との関係から数式で解き明かします。
ランダムフォレストとバギングの分散低減理論
ランダムフォレストがなぜ過学習に強いのか。木を脱相関させて分散だけを削るバギングの数理を、相関ρと木数Bの式から押さえれば、木の本数や特徴サブサンプリング数の調整に根拠が持てます。
リング注意と文脈並列
1枚のGPUに載らない超長文脈を、系列を割って複数デバイスへ分散し学習・推論する。リング状のKV交換と通信の重ね合わせで、近似なしにメモリを系列長に対し一定へ抑える勘所を掴めます。
ロジスティック回帰とシグモイド・対数尤度の導出
なぜ確率を直接ではなく対数オッズを線形に置くのか。シグモイド・交差エントロピー・凸性・IRLSまでを一本の導出で繋ぎ、暗記だった更新式が必然に変わります。
過学習と汎化
訓練データを“覚えすぎて”未知データで外す現象が過学習。本当に欲しいのは、見たことのないデータでも当たる「汎化」性能。
拡散トランスフォーマ(DiT)
U-Netを外してトランスフォーマを拡散の骨格に据えると、なぜ素直にスケールして高品質になるのか。パッチ化・adaLN条件付け・スケーリング特性を原理から押さえ、画像から動画までの生成基盤の共通土台をつかめます。
拡散モデル
高品質で多様な画像を安定して生成できる、画像生成AIの主流アプローチが拡散モデル。ノイズだらけの状態から少しずつノイズを取り除いて画像を作る仕組みを解説。
拡散モデルの数理:前向き拡散と逆向き生成
なぜノイズだけから画像が生まれるのか。前向きにデータを壊す過程と、その逆をたどる生成を数式の意味から理解し、ノイズ予測という学習目標の正体をつかめます。
確率分布と指数型分布族の早見
ガウスもベルヌーイもポアソンも、指数型分布族という一つの型の特殊例だと分かれば、共役事前分布や自然パラメータの正体が腑に落ち、確率モデルの設計が一望できるようになります。
学習率スケジュールとウォームアップの原理
学習率を固定すると序盤で発散し終盤で詰め切れない。ステップ減衰・コサイン・ウォームアップ・One-Cycleの設計意図と、Transformerでwarmupが必須な理由を原理から解く。
活性化チェックポイントとメモリ最適化
GPUメモリ不足で層を積めない、そんな壁を活性化チェックポイントが崩す。逆伝播用の活性を捨てて再計算に置き換える原理と、平方根で効くメモリ削減、ZeROと重ねる勘所まで一本で押さえます。
活性化関数の系譜と設計:Sigmoid から GELU・SwiGLU まで
活性化関数を微分形で並べ直せば、勾配消失も死活問題もなぜ起きるか一目で分かる。Sigmoid から GELU・SwiGLU までの設計判断を原理から押さえ、Transformer の選定理由まで一本道で理解できます。
機械学習とは(学習の種類)
ルールを人が書く代わりに、大量のデータから“パターン”を自動で見つけ出す手法。教師あり・教師なし・強化学習の3つが柱。
強化学習
正解データがなくても、試行錯誤と報酬だけで賢い振る舞いを学ばせる枠組み。状態・行動・報酬の繰り返しという仕組みを、ゲームやロボット、RLHFの例で理解。
強化学習アルゴリズムの系統図
Q学習からPPO・SAC・AlphaZeroまで、乱立する強化学習アルゴリズムを3つの軸で一望できます。価値か方策か、モデルの有無、オン/オフ方策という分類で派生の理由と年代がつながります。
強化学習の数理:ベルマン方程式と価値関数
強化学習の「なぜ学べるのか」を支える背骨が価値関数とベルマン方程式。割引報酬・状態価値・行動価値から最適方程式と価値反復まで、原理を一本の線でつなぎます。
教師あり・教師なし・強化学習
自分の課題にどの学習方式が向くかが分かる。機械学習の3分類を、正解ラベルの有無や報酬の使い方の違いから代表例とともに整理。
近似最近傍探索の内部:HNSW・IVF・PQ
数億ベクトルでも数ミリ秒で近傍を返せる仕組みが腑に落ちる。HNSW・IVF・PQの内部動作と、再現率と速度のトレードオフを設計者目線で正確に解説。
系列モデルの系譜:RNN→Transformer→SSM
系列モデルがなぜRNNからTransformer、そしてSSMへ分岐したのかを、計算量・長距離依存・並列性の三軸で系統立てて掴めます。各世代の得失を一望し、設計判断の根拠を得られます。
決定木の分割基準とCART/ID3の内部
決定木のハイパーパラメータ調整やライブラリ選定で迷うのは、分割基準の中身を知らないからです。ジニ・エントロピー・分散減少と剪定の原理を押さえれば、なぜ過学習するか・どう抑えるかが根拠を持って判断できます。
幻覚(ハルシネーション)の発生機構と抑制
LLMの幻覚は事故ではなく最尤訓練の必然。分布外・自己回帰の誤差累積・知識境界という根本原因を押さえれば、RAGや較正で当てずっぽうを体系的に減らせます。
誤差逆伝播法(バックプロパゲーション)の数理
なぜニューラルネットは数百万の重みを一気に学習できるのか。その答えが、連鎖律を計算グラフ上で逆向きに流すバックプロパゲーション。勾配計算の正体を原理から掴めます。
勾配クリッピングと学習の安定化
損失が突然NaNに飛ぶ学習を、閾値ひとつで安定させられる。ノルムクリッピングと値クリッピングの仕組み、RNNやRLHFで効く理由、適応的クリッピングまで原理から掴めます。
勾配ブースティングの原理:GBDT・XGBoost・LightGBM
表形式データで今なお最強級の精度を出す勾配ブースティング。残差を逐次的に潰す仕組みと、XGBoost・LightGBM が桁違いに速い理由を原理から掴めば、ハイパラ調整に根拠が持てます。
勾配降下法
モデルがどう学習するかの核心がこれ。勾配降下法は損失が小さくなる方向へパラメータを少しずつ更新する基本アルゴリズム。学習率や局所解の扱いまで整理。
勾配消失・勾配爆発と残差接続(ResNet)の原理
層を深くすると学習が止まる理由を、勾配の連鎖積という一点から理解できる。なぜ恒等写像を一本足すだけで超深層が学習可能になるのか、その仕組みを式で掴めます。
勾配蓄積と実効バッチサイズの拡大
GPUメモリが足りなくても大バッチ学習は諦めなくていい。勾配蓄積でマイクロバッチを積み上げ、実効バッチを自在に拡大する原理と、BatchNorm・分散同期で踏む落とし穴を押さえます。
合成データ生成
実データが枯れても、モデル自身に学習データを作らせて性能を伸ばす。蒸留・自己改善の原理と、モデル崩壊を避けるフィルタリング設計まで腹落ちする。
混合精度学習と数値安定性(FP16/BF16)
メモリ半減と高速化を、精度を落とさず両取りする鍵が混合精度。FP16 と BF16 の違いと損失スケーリングの原理を押さえれば、学習が NaN で落ちる原因まで見通せます。
最適化アルゴリズムの系統:SGD から Adam・AdamW まで
学習率を手で詰める前に系譜を押さえれば設定が一気に楽になる。SGD・モメンタム・RMSProp・Adam・AdamW を更新式で結び、なぜ AdamW が標準なのかまで一本道で理解する。
最適化アルゴリズムの派生系統図
新しい最適化器が出るたびに調べ直すのは終わり。SGD を根として派生を1本の系統樹に並べれば、各手法が「何を1つ足したか」で一望でき、未知の派生も同じ軸で読めます。
最尤推定とMAP推定・ベイズ推論の関係
MLE・MAP・ベイズが別物に見えて実は一本の階段だと分かれば、L2正則化がガウス事前・L1がラプラス事前だと数式で腑に落ち、損失設計の根拠が手に入ります。
思考の連鎖(Chain-of-Thought)と推論の引き出し
多段の問題でモデルがいきなり答えるのをやめさせるだけで精度が跳ね上がる。CoT が効く原理と自己整合性・ToT・推論時計算スケーリングを押さえれば、追加学習なしで推論性能を引き出せます。
視覚・言語・行動モデル(VLA)
カメラ画像と言語指示から直接ロボットの動作を出力する仕組みが腑に落ちる。視覚言語モデルに行動を接ぎ木するVLAの原理、行動トークン化、模倣学習との統合、汎化の壁までを内部から解説します。
自己教師あり学習:マスク予測と対照学習の系統
ラベルなしの生データだけで転移に強い表現が手に入る。BERT/MAEのマスク予測、SimCLRの対照、BYOL/DINOの自己蒸留、SwAVのクラスタリングを系統立て、表現崩壊をどう避けるかを比較します。
自動微分(Autograd)の仕組み
あなたが`loss.backward()`と書くだけで全パラメータの勾配が返る理由がここに。連鎖律を機械的に積み上げる自動微分の内部を、前進・逆伝播モードと計算グラフから正確に解く。
主成分分析(PCA)と特異値分解の数理
高次元データを少ない軸へ圧縮する原理を、分散最大化と再構成誤差最小化が同値であること、そしてSVDとの一致まで導出。寄与率・白色化・線形の限界まで腑に落とせます。
重み初期化の理論:Xavier と He 初期化
初期値の散らばり方ひとつで学習は止まる。信号の分散保存という一本の原理から Xavier と He のスケールを自分で導出でき、活性化に応じた使い分けと勾配崩壊の回避までつながります。
情報理論の基礎:エントロピー・KL・相互情報量
交差エントロピー損失もKL正則化も対照学習も、根っこは情報理論の3つの量です。エントロピー・KL・相互情報量を一本の筋で押さえれば、機械学習の目的関数が「測りたい不確実性」として読めるようになります。
状態空間モデルとMamba:アテンションを超えるか
長文でアテンションが二乗に膨らむ壁を、状態空間モデルは系列長に線形なコストで越える。S4 から Mamba の選択的状態空間まで、再帰と畳み込みの二重表現で原理を解く。
推論時スケーリング(テスト時計算)
モデルを再学習せず、推論のときに計算を積むだけで難問の正答率が伸びる。生成延長・並列サンプリング・探索・検証という4軸と計算対精度のスケーリング則を押さえれば、o1型モデルの設計思想を内側から理解できます。
制約付きデコーディングと構造化生成
LLM の出力を必ず正しい JSON や文法に従わせたい。後処理やリトライに頼らず、生成の各ステップでトークン候補を制約すれば、形式違反をゼロにできます。
正規化フロー:可逆変換と厳密尤度
近似に頼らず生成モデルの尤度を厳密に計算したい。可逆写像とヤコビアン行列式で変数変換し、log 尤度を正確に最適化する仕組みと、設計上の制約まで腑に落ちます。
正規化層の内部:Batch・Layer・RMSNorm の違い
正規化の違いは「どの軸で統計を取るか」一点に集約される。ここを押さえれば、画像がBatchNorm、TransformerがLayerNorm・RMSNormとPre-LNを選ぶ理由まで式で見通せる。
正則化(過学習対策)
学習データだけに過剰適合する過学習を抑え、未知データへの汎化を高める手法の総称。複雑さに罰則を与える考え方と、L1/L2・ドロップアウト・早期終了をやさしく整理。
生成モデルの系統図:VAE・GAN・拡散・自己回帰
乱立する生成モデルを一本の地図でつかめます。尤度を明示するか暗黙にするか、どう生成するかの2軸で4系統を整理し、派生と得意分野まで俯瞰します。
潜在拡散モデル(Latent Diffusion)の設計
なぜStable Diffusionは家庭用GPUで高解像度画像を生めるのか。重い拡散をピクセルではなく圧縮した潜在空間で走らせる二段構造と、テキスト条件付けの仕組みまで一気につかめます。
線形アテンションと効率的アテンションの系統
長文でアテンションが二乗で重くなる壁を、線形・低ランク・疎の三系統がどう崩すかを整理。各手法の近似の出どころと精度の代償を見極め、用途に合う一手を選べるようになる。
損失関数の数理:交差エントロピーと最尤推定の関係
なぜ分類は交差エントロピー、回帰は二乗誤差なのか。答えは全部、最尤推定という一つの原理から出てくる。バラバラに覚えた損失関数が一本の筋で繋がります。
損失地形(Loss Landscape)と平坦解の汎化
学習が収束したのに汎化しない理由は、たどり着いた谷の「形」にある。非凸損失地形の幾何から平坦解が効く理屈、SAMで平坦さを直接狙う手法までを一本で押さえる。
多トークン予測(Medusa・EAGLE)
別モデルを載せずに LLM を速くしたいなら多トークン予測。本体にヘッドを足す Medusa と、特徴量を先読みする EAGLE の原理とツリー検証を押さえれば、投機の主流手法を選び分けられる。
対照学習の原理:InfoNCEとSimCLR/CLIP
ラベルなしのデータから「似ているか」を当てさせるだけで、転移に強い表現が手に入る。InfoNCE損失が相互情報量の下界になる仕組みと、温度・バッチサイズ・射影ヘッドの役割を数理から押さえます。
探索と活用:UCB・トンプソン抽出・多腕バンディット
限られた試行で最大の報酬を得るには、未知の腕を試す探索と良い腕を引く活用のバランスが鍵。UCBとトンプソン抽出が後悔をなぜ対数オーダーまで抑えられるのか、Lai-Robbins下界まで原理から理解できます。
長文脈化と位置符号化の外挿
訓練長の数倍まで文脈窓を延ばしても壊れない理由を原理から理解できる。位置補間・NTK-aware・YaRN の効かせ分け、注意のシンクを使うストリーミング推論、そして「使える長さ」を測る評価まで整理。
敵対的サンプルとロバスト性の数理
人間に見えない微小なノイズでモデルが誤分類する理由を、FGSM/PGD攻撃と敵対的訓練のmin-max最適化から原理で理解し、認証付きロバスト性まで掴めます。
転移学習
少ないデータでも高い精度を狙える手法。学習済みモデルの知識を別タスクに再利用し、一から学習せずに済む転移学習の考え方と利点をやさしく解説。
投機的デコーディングとドラフトモデル
LLM の生成が遅いのは1トークンずつしか進めないから。小モデルで先読みし大モデルで一括検証する投機的デコーディングなら、出力分布を一切変えずに体感速度を数倍にできる。
凸最適化と勾配法の収束保証
勾配降下が「いつ・どれだけ速く収束するか」を数理で保証できる。凸性とL-平滑性から導く反復回数の見積もり、条件数が決める速さ、Nesterov加速の限界までを整理。
二次最適化:ニュートン法と準ニュートン法
曲率を使えば学習率調整に悩まず一気に最小へ近づける。ニュートン法・L-BFGS・自然勾配/K-FACの原理と、なぜ深層学習では一次法が主流かを計算量と確率性から整理する。
分散学習:データ並列・モデル並列・ZeRO
巨大モデルが1枚のGPUに載らない理由と、データ・テンソル・パイプライン並列の分割軸、ZeROの状態分割を押さえれば、学習を多GPUへ正しくスケールさせる勘所が一本でつながる。
分類器フリーガイダンスと条件付き拡散生成
別途の分類器を学習せず、条件付きと無条件のスコアを外挿するだけで、プロンプト忠実度を自在に強められる仕組みがわかる。品質と多様性のトレードオフや過飽和の正体まで一気に押さえられます。
分類評価指標の数理:ROC・PR・F1・AUC
閾値ひとつで適合率も再現率も動く分類評価を、混同行列からROC・PR・AUCまで一本の筋で理解できます。不均衡データでROCが楽観的に見える理由と、目的に沿った閾値の選び方が腑に落ちます。
変分推論(Variational Inference)の数理
解けない事後分布の積分を、最適化問題にすり替えて高速に近似する仕組みが分かれば、ELBO最大化とKL最小化が同じ操作だと腑に落ち、CAVI・SVI・VAEまで一本の原理で見通せます。
報酬ハッキングとアライメント
報酬スコアは上がるのに品質は下がる——この最悪の見落としがなぜ起きるのか。仕様ゲーミング、代理目標の誤り、RLHFの過適合とグッドハートの法則を原理から整理し、監視・評価の勘所まで掴めます。
報酬モデルの学習とブラッドリー・テリーモデル
「どっちが良い?」の選好データから、なぜスカラー報酬が学べるのか。ブラッドリー・テリーモデルの原理と、報酬ハッキングを防ぐKL制約まで、RLHFの心臓部を数式の意味から理解できます。
宝くじ仮説とスパースネットワーク
巨大モデルを9割削っても精度を保てる理由がわかる。密な網に潜む当選券(疎な部分網)を、反復枝刈りと巻き戻しで掘り当てる原理と実用を整理。
方策勾配法と Actor-Critic・PPO
方策を直接勾配で動かす強化学習の本流を、定理の導出から実装の勘所まで一気通貫で理解できます。ベースラインで分散を抑え、PPOのクリップで暴走を止める設計の理由がつながります。
埋め込み(Embedding)とベクトル検索
単語・文・画像を「意味を座標にした数値の列(ベクトル)」へ変換する技術。意味が近いものはベクトルも近くなるので、キーワード一致ではなく“意味”で検索・比較できる。
埋め込み空間の幾何:等方性とコサイン類似度
コサイン類似度がなぜ効くのか、効かないのかを幾何で理解できる。異方性(狭い円錐への集中)の正体と、ホワイトニングで類似度品質を底上げする勘所を押さえる。
誘導ヘッドと機械論的解釈可能性
LLMがなぜ文脈から学べるのかを回路レベルで開封。誘導ヘッドの仕組みを掴めば、in-context学習の挙動を予測でき、解釈可能性研究の最前線を実装目線で追えます。
量子化と蒸留:モデル圧縮の原理
巨大モデルを軽くする量子化・蒸留・プルーニングを数理で腑分け。なぜビットを削っても壊れないかが腹落ちし、圧縮の打ち手を自分で選べるようになる。