AB
AiBoss
project

Talksign-1 - TalksignのAI搭載リアルタイムアメリカ手話翻訳モデル

Talksign-1は、アメリカ手話(ASL)専用に設計されたAIリアルタイム翻訳モデルです。双方向変換に対応しており、カメラを通して3Dの人体キーポイントを捉え、250のASL単語を認識したり、音声/テキストを手話動画に変換したりできます。

Talksign-1とは何ですか?

Talksign-1は、アメリカ手話(ASL)専用に設計されたAIリアルタイム翻訳モデルです。双方向翻訳に対応し、カメラで3D人体キーポイントをキャプチャして250のASL単語を認識したり、音声/テキストを手話ビデオに変換したりできます。TensorFlow/Kerasをベースに構築されたこのモデルは、Transformerで強化されたCNNアーキテクチャを採用し、推論レイテンシは100ミリ秒未満で、ブラウザ上で実行可能です。WLASL2000データセットでトレーニングされており、現在は個別のジェスチャー認識に対応しています。教育、医療、職場などのシナリオに適しており、聴覚障害者のコミュニケーションアクセシビリティの向上を目指しています。

Talksign-1の主な機能

  • Sign-to-Speechこのシステムは、カメラを使用して人体の主要なポイントを3Dで捉え、250のアメリカ手話の単語をリアルタイムで認識し、音声またはテキストに変換します。推論の遅延時間は100ミリ秒未満です。
  • Speech-to-Sign入力された音声またはテキストを手話のビデオシーケンスに変換し、オプションで後続のレンダリング用の3D仮想人間アニメーションデータの生成をサポートします。
  • モーションセンシングゲーティングモデル推論は、意味のあるジェスチャーが検出された場合にのみトリガーされるため、計算負荷と誤認識率を効果的に低減できます。
  • ネイティブブラウザのサポートすべての機能は、追加のソフトウェアやハードウェアをインストールすることなく、標準的なウェブブラウザで実行できます。

Talksign-1の技術原理

  • 入力処理とプライバシー保護Talksign-1はMediaPipeを使用して、ブラウザ側で3Dボディ、手、顔のキーポイントの座標をリアルタイムで抽出し、匿名化されたキーポイントデータのみをバックエンドAPIに送信して、さらなる処理を行います。
  • モデルアーキテクチャとトレーニングコアモデルはTensorFlow/Kerasフレームワークに基づいて構築されており、Transformerと畳み込みニューラルネットワークを統合することで、手話ジェスチャーの空間的特徴と時間的依存関係を同時に捉えることができるハイブリッドアーキテクチャを形成しています。このモデルは、大規模なアメリカ手話データセットであるWLASL2000で学習されており、日常生活でよく使われる個々のジェスチャー単語の認識に重点を置いています。
  • リアルタイム推論メカニズムこのシステムは、30フレームのスライディングバッファ(約1秒間)を保持し、入力されたキーポイントシーケンスに対して時空間パターン分析を実行し、エンコーダー・デコーダー構造を通して最も可能性の高い手話の単語とその信頼度スコアを出力することで、低遅延で連続的なジェスチャー認識を実現します。
  • デプロイメントアーキテクチャプラットフォーム全体はマイクロサービスアーキテクチャを採用しています。フロントエンド、バックエンド、および2つのAIエンジン(sign2speechとspeech2sign)はすべて、Docker Composeオーケストレーションを介して単一のEC2インスタンス上で動作し、TLS終端とリバースプロキシにはNginxが使用されます。各AIサービスは独立したコンテナとしてデプロイされ、インスタンスリソースの追加による垂直スケーリング、またはノードの追加による水平スケーリングに対応しています。モデルの重みは、外部のクラウドストレージサービスに依存することなく、ローカルファイルシステムからロードおよび起動されます。

Talksign-1プロジェクトの住所

  • プロジェクト公式サイト:https://www.talksign.co/blog/introducing-talksign-v1
  • トライアルに申し込む:https://app.foorm.xyz/f/talksign-v1-feedback

Talksign-1の応用シナリオ

  • 教育このシステムは、聴覚障害のある生徒と教師の間でリアルタイムの手話通訳をサポートし、より包括的な教室環境を作り出し、学習リソースへの平等なアクセスを保証します。
  • 健康管理このモデルは、患者と医療スタッフ間の直接的かつ明確なコミュニケーションを可能にし、人間の通訳が到着するのを待つことなく、診断の精度と看護の質を向上させる。
  • オフィス聴覚障害のある従業員が会議での議論やチームワークに完全に参加し、人事やコンプライアンスに関する情報をリアルタイムで入手できるよう、手話通訳サービスを提供します。
  • 公共空間交通情報、緊急警報、公共サービス情報などは、瞬時に手話に変換され、個人の端末やデジタルディスプレイに配信される。
  • 放送とテレビこの膜技術は、ニュースの生放送、エンターテイメント番組、速報ニュースなどに、画面上で手話による仮想人間による放送を提供することで、コンテンツのアクセシビリティを向上させることができる。