AB
AiBoss
project

HistAgent - プリンストン大学と復旦大学が共同で開発した、AIを活用した歴史研究アシスタント

HistAgentは、プリンストン大学AI研究所と復旦大学歴史学部が共同開発したAIアシスタントシステムで、歴史研究に特化して設計されています。歴史研究におけるマルチモーダル情報処理、多言語分析、複雑な推論に対応しています。

HistAgentとは何ですか?

HistAgentは、プリンストンAIラボと復旦大学歴史学部が共同開発した、歴史研究に特化したAIアシスタントシステムです。マルチモーダル情報処理、言語横断的分析、複雑な推論など、歴史研究における様々な課題に対応します。HistAgentは、写本、画像、音声、動画、碑文、テキストなど、多様な歴史資料を処理でき、29の古代および現代言語に対応し、古代から現代までの複数の時代、そして世界各地のコンテンツを網羅しています。歴史的推論に特化したベンチマークであるHistBenchにおいて、HistAgentは汎用的な大規模言語モデルや他のAIエージェントを大きく上回る性能を発揮します。

HistBenchは、プリンストン大学AIラボと復旦大学歴史学部が共同開発した、歴史研究能力に特化した世界初のAIベンチマークです。人文科学分野におけるAIテストの空白を埋め、歴史学分野におけるAI能力の体系的なテストとブレークスルーを促進します。

HistAgentの主な機能

  • マルチモーダルデータ処理HistAgentは、写本、画像、地図、音声、動画など、さまざまな歴史資料を処理できます。OCRモジュールを使用して写本や碑文などの文書を認識し、画像検索や遺物認識をサポートし、歴史的な演説やインタビューの書き起こしなどの音声資料も処理できます。
  • 多言語対応HistAgentは、古典語やあまり一般的でない言語を含む、古代語と現代語の両方を含む29言語の翻訳と処理をサポートしています。テキストの表面的な意味を翻訳できるだけでなく、文脈を考慮して翻訳を最適化することも可能です。
  • 文献検索と文書解析HistAgentは、複数ステップのウェブページ検索と解析をサポートし、学術ウェブサイトや過去のデータを取得できます。また、PDF、DOCX、XLSX、PPTXなど、さまざまな形式のファイルを解析できます。
  • 歴史的推論と情報統合HistAgentは、歴史的知識と推論能力を組み合わせることで、研究者が手がかりを整理し、情報を統合し、学術的な判断を下すのを支援します。中央のスケジューリングモジュール(マネージャーエージェント)を通じて、さまざまなサブモジュールをインテリジェントに調整し、タスクの要件に応じて適切なツールを呼び出し、マルチモーダルな結果を統合し、最終的に歴史学の基準に準拠した完全な回答を出力します。
  • マルチエージェントコラボレーションHistAgentは、複数のサブモジュールを含むマルチエージェント協調システムです。歴史研究のプロセスをシミュレートし、複雑なタスクを複数のサブタスクに分解し、各サブタスクのニーズに応じて最適なツールを呼び出すことができます。

HistAgentの技術原理

  • マルチエージェントアーキテクチャHistAgentはマルチエージェントシステム設計パターンを採用しています。複雑なタスクは複数のサブタスクに分割され、それぞれ異なるエージェントに割り当てられて処理されます。各エージェントは、画像認識、言語翻訳、文書検索など、特定のタスクに特化しています。このようにして、HistAgentは様々な種類の履歴データを効率的に処理し、異なるモダリティからの結果を統合することができます。
    • タスクの計画と実行ユーザーが入力したクエリは、まず複数のサブタスクに分割され、それぞれが対応するエージェントによって実行されます。実行結果は監視および検証され、結果が不十分または誤りである場合は、システムはタスクを再計画および調整します。
    • 多角的視点からの分析と協働マルチエージェントアーキテクチャは、さまざまな視点から問題を分析することを可能にし、各エージェントは特定の領域の問題に独立して対処できるため、メモリとプロンプトの長さに関する要件が軽減されます。
  • マルチモーダル処理技術HistAgentは、テキスト、画像、音声、動画など、複数のモダリティの履歴データを処理できます。マルチモーダル処理技術の中核は、異なるモダリティからの情報を統一された意味表現に変換し、さらなる分析と推論を容易にすることにあります。
    • 画像処理画像や動画は、コンピュータビジョン(CV)モデル(YOLOv8など)を用いて処理され、重要な情報が抽出されて構造化された記述に変換されます。そして、その構造化された記述は、大規模な言語モデルのコンテキストに組み込まれます。
    • 音声処理音声は自動音声認識(ASR)技術(Whisperなど)を用いてテキストに変換され、その後、大規模な言語モデルによって処理され、最終的にテキスト読み上げ(TTS)技術を用いて出力される。
  • 知識の向上と推論推論の精度と信頼性を向上させるため、HistAgentは知識拡張技術を採用しています。知識ベースに文書をベクトル形式(ChromaDBなど)で保存することで、ユーザークエリの処理時に関連知識が動的に取得され、挿入されます。これにより、大規模言語モデルにおける錯覚問題を効果的に抑制し、出力結果の信頼性を向上させます。
  • ツールの呼び出しと拡張HistAgentは、外部ツールやプラグインの動的な呼び出しをサポートしています。ツール呼び出しモジュールを使用することで、HistAgentは文書の取得や解析といったタスク要件に基づいて、特定のAPIやツールを呼び出すことができます。これによりシステムの柔軟性が向上し、開発者は新しいプラグインを追加することでHistAgentの機能を拡張できます。
  • メモリシステムHistAgentのメモリシステムは、短期記憶と長期記憶を含むハイブリッドメモリアーキテクチャを採用しています。短期記憶は現在のタスクに関するコンテキスト情報を格納し、長期記憶はベクトルデータベース(ChromaDBなど)を通じて重要な履歴情報を保存します。

HistAgentプロジェクトのアドレス

HistAgentの応用シナリオ

  • 文献の検索と分析複数段階のウェブ検索とページ解析を通じて、学術ウェブサイトや歴史資料を取得し、信頼できる背景情報と裏付けとなる証拠を提供する。
  • 画像と文化遺産の認識画像逆検索や文化遺物の識別を実行でき、歴史的画像資料の出典を特定し、背景情報を補足することができる。
  • 歴史的推論と手がかりの統合それは歴史的知識を組み合わせて推論を助け、研究者が手がかりを整理し、情報を統合し、学術的な判断を下すのに役立つ。
  • 歴史の教材本書は、教師が授業設計を行い、教育効果を向上させるのに役立つ豊富な歴史資料や事例研究を提供する。
  • 文化遺産保護画像認識技術とOCR技術を用いて、古代の書物や碑文といった文化遺産の保護と研究を支援しています。

HistBenchの機能

  • 質の高い問題集HistBenchデータセットには、歴史家によって作成された414の質の高い歴史に関する質問が含まれており、基本的な歴史資料の読解から、詳細な学際的分析まで、複数のレベルを網羅しています。
  • 多言語・マルチモーダルな報道このベンチマークは、29の古代および現代言語を網羅し、写本、画像、音声、動画、歴史的遺物など、さまざまな種類の歴史資料をサポートしており、歴史研究のシナリオをリアルにシミュレートします。
  • 難易度問題は難易度別に3段階に分けられており、基本的な情報検索から、複雑なマルチモーダルな歴史データの処理、学際的な分析まで多岐にわたる。
    • レベル1(基本):歴史背景アシスタントが作成した166問の質問は、基本的な情報検索と抽出に焦点を当てている。
    • レベル2(上級):大学院生によって作成された問題172は、一定レベルの資料処理能力または論理的推論能力を要求する。
    • レベル3(チャレンジ):ベテラン研究者によって作成された76の質問は、少数言語/死語の読解、マルチモーダルな歴史資料の処理、学際的な分析といったトピックを網羅している。
  • 幅広い歴史的分野を網羅古典研究、世界史、現代文化史、美術史、環境史、科学技術医学史など、20以上の歴史的地域と36の分野を網羅している。