英伟达发布 NV-Reason-CT:面向 3D CT 的开放视觉语言模型
英伟达开发者博客介绍 NV-Reason-CT,一款面向 3D CT 体积影像的开放视觉语言模型,可生成结构化报告与模拟放射科医生思路的推理链,并在 CT-RATE 基准上给出评测结果。
核心事实
英伟达开发者博客发布文章,介绍 NV-Reason-CT——一个面向 3D CT 体积影像的开放视觉语言模型(VLM)。据该文描述,模型将完整 3D 视觉 Transformer 编码器与 Qwen3.5-4B 语言模型结合,训练目标是生成模拟放射科医生系统性阅片过程的思维链推理,并支持结构化报告生成与多轮追问对话。文章称其在 CT-RATE 基准上取得 Macro-F1 0.614、Macro-AUROC 0.871,并列出与 VoxelFM、Pillar-0、CT-CLIP、Merlin、ClinFusion-8B、MedGemma 1.5 等基线的对比表格。
背景与影响
文章指出,3D CT 单次检查可达数百张轴位层面,常规 2D 编码器难以还原层间空间关系,而多数开放医学模型也缺少多步对话与可审计的推理过程。NV-Reason-CT 延续 NV-Reason-CXR 的推理方法,采用监督微调加强化学习的两阶段训练,并称已获美国国立卫生研究院(NIH)放射科医生对报告质量与推理合理性的评审意见。文章强调,该模型是面向研究与开发的开放基础模型,并非自主诊断系统,也不是已获批的临床产品,研究者可基于其进行后续训练以适配特定 CT 应用;相关能力、可用范围与许可条件请以官网当前信息为准。
限制与来源
上述性能数字、训练数据构成与临床评审结论均来自英伟达开发者博客原文,本文未做独立验证。文中提及的临床研究进展、模型开放程度与后续集成计划,部分尚未获官方进一步确认,具体以官方发布为准。本文不构成任何医疗或投资建议。来源:developer.nvidia.com 博客文章《Introducing NV-Reason-CT Open 3D CT VLM for Radiologist Chain-of-Thought Reasoning》。