project
Circuit Tracer - AnthropicのオープンソースAIモデル内部意思決定追跡ツール
Anthropic社が開発したオープンソースツールであるCircuit Tracerは、大規模言語モデルの内部構造を研究するために使用されます。Circuit Tracerは、生成属性グラフに基づいてモデルの生成特性を明らかにします。
回路トレーサーとは何ですか?
Anthropic社が開発したオープンソースツールであるCircuit Tracerは、大規模言語モデルの内部動作を研究するために使用されます。生成アトリビューショングラフに基づいて、Circuit Tracerはモデルが特定の出力を生成するために踏む手順を明らかにします。アトリビューショングラフは、研究者がモデルの意思決定プロセスを追跡し、特徴間の関係を視覚化し、さまざまな仮説を検証するのに役立ちます。Circuit Tracerは、GemmaやLlamaなど、いくつかの人気のあるオープンソースモデルをサポートしており、Neuronpediaに基づいたインタラクティブな視覚化インターフェースを提供することで、ユーザーによるモデルの動作の探索と分析を容易にします。
Circuit Tracerの主な機能
- 属性マップを生成するこれはモデルの意思決定経路を明らかにし、特徴量とノード間の影響関係を示します。
- 視覚化とインタラクションインタラクティブなインターフェースに基づいているため、帰属図を直感的に表示および操作でき、理解しやすく共有しやすい。
- モデル介入特徴量の値を変更し、出力の変化を観察することで、モデルの動作を検証します。
- 複数のモデルに対応GemmaやLlamaといった主流モデルとの互換性があり、比較研究を容易にします。
サーキットトレーサーの技術原理
- トランスコーダー属性グラフは、事前学習済みのトランスコーダーを使用して生成されます。トランスコーダーとは、モデルの内部特徴をより理解しやすく解釈しやすい形式に変換するニューラルネットワークのコンポーネントです。Circuit Tracerは、このトランスコーダーに基づいて、モデル内の特徴とノード間の関係を捉えることができます。
- 直接効果の計算Circuit Tracerは、各非ゼロのトランスコーダ機能、トランスコーダエラーノード、および入力フラグが、他の非ゼロのトランスコーダ機能と出力ロジットに及ぼす直接的な影響を計算します。
- グラフ剪定生成されたグラフは剪定されます。剪定プロセスでは、影響力の低いノードとエッジが削除され、モデルの決定に大きく影響するものだけが残されます。剪定パラメータ(ノードやエッジの閾値など)はユーザーが定義でき、グラフの複雑さと明瞭さを制御できます。
- 対話型ビジュアルインターフェース本システムは、ウェブベースのインタラクティブな可視化インターフェースを提供し、ユーザーはブラウザ内でアトリビューショングラフを直接表示および操作できます。このインターフェースは、ノードのラベル付け、グループ化、および注釈をサポートしており、ユーザーはモデルの内部メカニズムをより直感的に理解および分析できます。
Circuit Tracerのプロジェクトアドレス
- プロジェクト公式サイト:https://www.anthropic.com/research/open-source-circuit-tracing
- GitHubリポジトリ:https://github.com/safety-research/circuit-tracer
サーキットトレーサーの応用例
- モデル行動研究帰属グラフ分析モデルに基づいて、特定の出力を生成する際の意思決定プロセスと内部ロジックを理解する。
- 多言語モデル分析多言語モデル(Llamaなど)の内部表現を研究し、異言語処理メカニズムを探求する。
- 多段階推論研究本分析の目的は、多段階推論タスクにおけるモデルの挙動を検証し、段階的な推論のプロセスと論理を明らかにすることである。
- モデルの最適化と改善介入機能テストのさまざまな仮説に基づいて、モデルの特定の動作が期待を満たしているかどうかを検証し、モデル構造を最適化する。
- 教育と共有インタラクティブなビジュアルインターフェースに基づいて、複雑なモデル意思決定プロセスを直感的に表示し、教育とコミュニケーションを促進します。