ニュース
Xiaohongshuは、エンドツーエンドの文書認識モデルであるFireRed-OCRをリリースし、オープンソース化しました。
Xiaohongshuチームは、Qwen3-VLアーキテクチャをベースとしたエンドツーエンドの文書認識モデルFireRed-OCRをリリースし、オープンソース化しました。このモデルは、「3段階の段階的最適化」戦略と「幾何学的+意味的」データファクトリーを先駆的に採用し、複雑な文書を処理する際に一般的なVLMモデルが直面する「構造的錯覚」問題を解決しました。権威あるベンチマークであるOmniDocBench v1.5において、総合スコア92.9%という最先端(SOTA)性能を達成し、Gemini-3.0 Proなどのモデルを凌駕しました。