チュートリアル
浙江大学の教科書「大規模モデルの基礎」(PDFファイル)
『大規模言語モデルの基礎』は、大規模言語モデル(LLM)の基礎、アーキテクチャ設計、学習最適化、および実践的な応用について包括的に解説します。言語モデルの基本理論から始まり、統計、RNN、Transformerに基づいたモデルへと掘り下げていきます。
《大型モデル「基礎」では、大規模言語モデル(LLM本稿では、言語モデルの基礎、アーキテクチャ設計、学習最適化、および応用について解説します。言語モデルの基本理論から始め、統計、RNN、およびTransformerに基づくモデルアーキテクチャを掘り下げ、大規模言語モデルのアーキテクチャタイプ(エンコーダーのみ、エンコーダー・デコーダー、デコーダーのみなど)とその代表的なモデル(BERT、T5など)に焦点を当てます。GPT(シリーズ)本書では詳細に解説しています。Promptエンジニアリング、パラメータ高効率本コースでは、ファインチューニング、モデル編集、検索強化生成といった主要な技術を網羅し、実際の事例を通して様々なシナリオにおける応用例を示します。体系的な学習と実践的なガイダンスを通して、読者が大規模言語モデリング技術を深く理解し、効果的に応用できるようになることを目指します。
入手する大型モデルベースオリジナルのPDFレポートファイル。QRコードをスキャンしてフォローおよび返信してください。 20250915
言語モデルの基礎
- 統計的手法に基づく言語モデルこのセクションでは、nグラムモデルとその統計的原理(マルコフ仮説、最尤推定)について説明します。
- RNNベースの言語モデルループの説明ニューラルネットワークRNNの構造、学習上の問題(勾配消失/勾配爆発)、および言語モデリングにおける応用。
- トランスフォーマーベースの言語モデル: Transformerアーキテクチャ(自己注意機構、FFN、層正規化、残差接続)の詳細な分析と、言語モデルへの応用。
- 言語モデルのサンプリング方法復号戦略には、貪欲探索、ビーム探索、トップKサンプリング、トップPサンプリング、および温度メカニズムが含まれる。
- 言語モデルの評価内部評価(パープレキシティなど)と外部評価(BLEU、ROUGE、BERTScore、G-EVALなど)を紹介します。
大規模言語モデルアーキテクチャ
- ビッグデータ+ 大型モデル → 新着知的本論文では、モデルサイズとデータサイズがモデルの能力に与える影響を分析し、スケーリング法則(カプラン・マッキャンドリッシュ、チンチラ)を紹介する。
- 大規模言語モデルのアーキテクチャの概要エンコーダーのみ、エンコーダー・デコーダー、デコーダーのみという3つの主流アーキテクチャのアテンションメカニズムと適用可能なタスクを比較する。
- エンコーダー専用アーキテクチャ本稿では、BERTを例として、その構造、事前学習タスク(MLM、NSP)、および派生モデル(RoBERTa、ALBERT、ELECTRA)を紹介する。
- エンコーダ・デコーダアーキテクチャ本稿では、T5とBARTを例にとり、それらの統一されたテキスト生成フレームワークと多様な事前学習タスクを紹介する。
- デコーダ専用アーキテクチャ詳細な紹介 GPT シリーズ(GPT-1から GPT-4)およびLLaMAシリーズ(LLaMA1/2/3)の開発と特性。
- 非トランスフォーマーアーキテクチャこのセクションでは、RWKVやMambaなどの状態空間モデル(SSM)と、テスト時トレーニング(TTT)パラダイムを紹介します。
Prompt プロジェクト
- Prompt プロジェクト概要:意味 Prompt そして Prompt 本プロジェクトでは、単語分割およびベクトル化プロセス(トークン化、埋め込み)を紹介します。
- 文脈内学習(ICL)このコースでは、ゼロショット学習、シングルショット学習、少数ショット学習に加え、例の選択戦略(類似性と多様性)について紹介します。
- 思考連鎖(CoT)CoTの3つのモード、すなわち段階的アプローチ(CoT、ゼロショットCoT、オートCoT)、行動前に考えるアプローチ(ToT、GoT)、および自己一貫性について説明します。
- Prompt スキルはじめにには仕様が含まれています Prompt 質問を適切に作成・要約し、必要に応じてCoT(認知指向療法)を用い、心理的暗示(ロールプレイング、シナリオへの没入)を効果的に活用する。
- 関連アプリケーション序論では、大型モデルの知的体(Agent)、データ構成、テキストからSQLへの変換、GPTSら
パラメータ高効率微調整
-
パラメータ高効率微調整入門このセクションでは、下流タスク適応のための2つの主要な手法、すなわちコンテキスト学習と指示の微調整を紹介し、パラメータに関する議論へと繋げます。高効率PEFT(精密調整技術)は、コスト削減と改善という観点から説明される。高効率効率性の面で利点がある。
-
パラメータ追加方法モデル構造に新しい、より小さな学習可能なモジュールを追加することでこれを実現する方法について、詳細な説明を記載します。高効率微調整の方法には、入力に(例えば…)を追加することが含まれます。Promptモデルへの追加(プレフィックスチューニングやアダプターチューニングなど)および出力への追加(プロキシチューニングなど)の実装と利点。
-
パラメータ選択方法このセクションでは、モデルパラメータの一部のみを微調整するための手法を紹介します。これらの手法は、ルールベースの手法(BitFitなど)と学習ベースの手法(Child-tuningなど)に分類されます。パラメータを選択的に更新することで、これらの手法は計算負荷を軽減し、モデルのパフォーマンスを向上させます。
-
低ランク適応法元の重み更新行列を低ランク行列で近似することにより、それを実装する方法を詳細に説明します。高効率LoRAとその派生版(ReLoRA、AdaLoRA、DoRAなど)に焦点を当て、微調整手法を紹介し、LoRAのパラメータ効率とタスク汎化能力について議論する。
-
実践と応用このセクションでは、HF-PEFTフレームワークの使用方法と関連技術を紹介し、表形式データのクエリと分析におけるPEFT技術の応用例を示し、PEFTが改善できることを証明します。大型モデル特定のタスクにおけるパフォーマンスの観点から見た有効性。
-
モデル編集の概要本稿では、モデル編集の概念、定義、性質を紹介し、大規模言語モデルにおけるバイアス、有害性、知識エラーを修正する上でのモデル編集の重要性について詳しく述べる。
-
モデル編集の古典的な方法モデル編集方法は、外部拡張方法(知識キャッシュや追加パラメータ方法など)と内部修正方法(メタ学習やローカリゼーション編集方法など)に分類され、それぞれの代表的な研究成果が紹介される。
-
追加パラメータ方式: T-Patcherこのセクションでは、モデルに特定のパラメータを付加することでモデル出力の精密な制御を実現するT-Patcherメソッドについて詳しく説明します。このメソッドは、以下のようなアプリケーションに適しています。速い、そしてモデル内の特定の知識ポイントを正確に修正するためのシナリオ。
-
位置編集方法:ROMEこのセクションでは、モデル内の特定の層またはニューロンを特定して変更することで、モデルの出力を精密に制御するROMEメソッドについて詳しく説明します。このメソッドは、モデルの内部知識構造を深く変更する必要があるシナリオに適しています。
-
モデル編集アプリケーションこのセクションでは、正確なモデル更新、忘れられる権利の保護、モデルセキュリティの強化といった分野におけるモデル編集の実践的な応用例を紹介し、さまざまなシナリオにおけるモデル編集技術の応用可能性を示します。
検索強化生成
-
検索強化生成の概要このセクションでは、検索強化生成の背景と構成要素を紹介し、その応用例について詳しく説明します。自然言語処理タスクにおいて検索と生成を組み合わせることでモデル性能を向上させることの重要性と応用シナリオ。
-
検索強化型生成アーキテクチャこのセクションでは、RAGアーキテクチャの分類、ブラックボックス拡張アーキテクチャ、ホワイトボックス拡張アーキテクチャを紹介し、さまざまなアーキテクチャの特徴と適用シナリオを比較分析します。
-
知識検索このセクションでは、知識ベースの構築、クエリの強化、検索エンジンと検索効率の向上、および検索結果の並べ替えによる検索パフォーマンスの向上方法について紹介します。
-
生成強化このセクションでは、強化を行うタイミング、強化を行う場所、複数回強化する方法、コスト削減と効率向上の方法を紹介し、さまざまなタスクにおける生成的な強化の適用戦略について議論します。
-
実践と応用セットアップ方法の紹介単純RAGシステムの各ステップを説明し、典型的なアプリケーションにおけるRAGの例を示すことで、読者が検索強化生成技術を理解し、応用できるように支援します。
入手する大型モデルベースオリジナルのPDFレポートファイル。QRコードをスキャンしてフォローおよび返信してください。 20250915