即使有了基因组测序,许多罕见病患者仍无法获得明确的遗传诊断。经过广泛检测和专家评估后,大约一半的患者仍无法确诊。他们的医疗数据中可能包含线索,但找到这些线索需要从数千到数百万个可能的遗传变异、零散的临床记录以及快速变化的科学文献中进行筛选。

随着新的基因-疾病关系、病例报告和分类证据的积累,未解决的病例可能变得可以重新解释。

来自波士顿儿童医院曼顿孤儿病研究中心、哈佛大学和OpenAI的研究人员使用OpenAI o3 Deep Research推理模型,分析了376个此前已分析但仍未解决的病例的去标识化临床和基因组信息。该模型为研究人员和临床医生提供了基于证据的候选解释以供审查。经过专家评审、额外检测和临床确认,医生在18个病例中确立了诊断——在专家先前分析的基础上,诊断率额外提高了4.8%。这项研究于2026年6月18日发表在《NEJM AI》上,展示了AI辅助研究流程如何帮助专家在重新审视一些最困难的病例时找到线索。

其中许多病例多年来一直未被专家分析所破解。在这项研究中,OpenAI o3 Deep Research帮助研究人员识别了线索,这些线索随后通过既定的临床流程进行了评估,表明随着知识的演变,由专家主导的定期重新分析可能变得更加可扩展。该模型并未对任何患者进行诊断或做出任何临床决策。它生成了基于证据的假设,供专家审查,并在适当时通过额外检测进行进一步调查,并在临床实验室中确认。

为什么旧病例可能包含新答案

一个不确定的遗传检测结果并不总是永久性的发现。患者的表型描述、检测结果和家族史可能分散在使用不同标识符、格式和词汇的数据库中。将这些记录关联起来很困难,因此即使是专家也可能漏诊。专家可能在相关基因或其变异与疾病关联之前就对儿童基因组进行了测序。随着科学知识的进步,相同的数据可以揭示以前无法发现的答案。

罕见病的重新分析既是一个科学问题,也是一个维护问题。患者的基因组可能保持不变,但围绕它的证据却在不断变化:研究人员将新的基因和变异与疾病联系起来,实验室重新分类旧变异,病例数据库和论文积累新的观察结果。每次更新都可能使旧的未确诊病例值得重新审视,因此许多机构积累了大量需要与不断变化的知识库保持同步的基因组。

在这项研究中,研究人员设计了工作流程,使模型在现有基因组分析流程之上充当一个以解释为先的推理层。模型不是仅返回一个排序后的基因,而是被要求将临床特征、遗传模式、变异证据和科学文献联系起来,形成一个人类评审员可以质疑的论证。

重新分析是如何进行的

对于每个病例,团队整理了一个去标识化的数据包,包含标准的人类表型本体术语来描述患者的临床表现、偶尔的临床医生笔记和任何描述性临床诊断、年龄和性别等元数据,以及一个过滤后的变异表。该表记录了每个变异的稀有性、其对编码蛋白质的预测影响、ClinVar分类以及可用家庭成员中的信号质量。大多数病例包括来自儿童及其亲生父母的数据。

团队要求模型提出最合理的分子解释,并展示其推理过程。然后,研究人员使用临床实验室用于分类遗传变异的相同ACMG/AMP框架审查输出结果。每个候选结果至少由两名团队成员审查,分歧通过共识解决,模型输出从未被视为诊断。只有在合格专家审查证据、变异被分类为致病性或可能致病性、CLIA认证实验室确认,并且临床团队将结果反馈给家庭后,发现才被计为诊断。

在分析未解决病例之前,团队在已确诊的病例上优化了工作流程。在包含各种罕见疾病的51个病例中,该流程在重复运行中恢复了48个病例的正确基因和变异。在一组57个神经肌肉病例中,该流程在重复运行中为45个病例返回了正确诊断。在一个15个病例的长读长基因组数据集中,该流程在每个病例中都命名了正确的基因,并在12个病例中命名了两个致病等位基因。这些评估有助于提示开发,并显示了专家审查仍然至关重要的地方。

模型自我报告的置信度分数与这些先前已解决病例中的正确诊断相关:一致正确判断的平均最低分数为85.6,而错误或未知判断的平均最低分数为42.1。这些分数并非校准后的概率,团队也未将其用作证据或临床裁决的替代品。但它们有助于指导专家评审员关注最有希望的候选诊断。

研究人员的发现

随后,团队将该流程应用于四组先前未解决的病例:患有神经发育疾病的儿童、患有罕见神经肌肉疾病的人、患有早期精神病的儿童和青少年,以及儿科突发意外死亡病例。这些并非等待首次审查的新病例。许多病例已经经过多个商业或机构流程的检查,并由多学科团队讨论过。

按队列划分的结果

队列病例数发现的诊断数****诊断率 神经发育 100 10 10.0% 神经肌肉疾病 61 4 6.6% 儿科突发意外死亡 200 2 1.0% 早期精神病 15 2 13.3% 总计37618****4.8%

早期精神病队列规模较小,因此其百分比具有较宽的置信区间。诊断率也反映了每个队列具有单基因解释的可能性。

在模型提出候选结果、专家完成审查和临床确认后,医生在4.8%的病例中确立了诊断。这个比率虽然不高,但在这一人群中具有重要意义,因为先前的专家审查未能解决这些病例。类似的重新分析研究报告称,在经过大量审查的病例中,诊断率仅有个位数增长;较高的诊断率通常来自包含新病例或等待遗传确认的已知疾病的研究。

在18项诊断中,有7项属于重新发现:这些诊断是在本地研究流程之外确立的,但团队审查的记录中并未包含。在多个案例中,这些变异已在公共数据库中被列为致病性或可能致病性,凸显了跨数据源整合信息的操作挑战。

识别变异时展现灵活性

在一个早期精神病案例中,模型推断出输入数据中未列出的基因组结构事件。它将22号染色体上一系列低质量测序结果与患儿的心脏、免疫、神经发育及精神特征联系起来,随后假设存在与迪乔治综合征相关的22q11.2缺失。这一假设的变异通过后续基因组测序得到确认。

尽管提示要求寻找单一单基因病因,但模型有时会提出两个基因以更好地解释复杂表现。在一个案例中,_LAMA2_和_FOXP1_的变异共同解释了肌肉和神经发育特征;另一个案例则存在涉及_TTN_和_SRPK3_的、此前未被识别的双基因解释。

生成可验证、生物学上连贯的假说

除诊断外,模型还为一种名为白癜风的疾病提出了可能的新型机制解释。在一个神经发育案例中,模型突显了一名白癜风患者_S1PR1_基因中11个氨基酸的缺失。_S1PR1_编码一种参与信号传导、免疫细胞迁移和组织生物学的细胞表面受体。模型整合证据表明,该缺失可能改变受体结构和信号传导方式,从而减少色素生成,同时帮助免疫细胞在皮肤中持续存在。

所提出的_S1PR1_-白癜风关联需要额外的实验验证,但这展示了人工智能在将结构生物学、免疫学和临床遗传学的零散发现转化为具体、可验证假说方面的强大作用。

团队在神经肌肉队列中也观察到可能的表型扩展。_HSPB8_和_CDK13_的有害变异与这些基因最广为人知的疾病不完全匹配,提示存在更广泛的临床谱系,需要更多病例和实验室工作来验证。

局限性

这项研究表明,通用推理模型能够通过整合表型、遗传模式、变异注释、数据质量模式和科学文献,形成可审查的假说,从而为回顾性基因组再分析做出贡献。这也说明了定期再分析的重要性:有些答案只有在知识进步或碎片化记录被整合后才会浮现。

这项研究并非证明患者、临床医生或客户应使用OpenAI模型来诊断疾病或做出医疗决策。它不描述或认可将OpenAI o3 Deep Research、ChatGPT或任何其他OpenAI产品用于诊断的预期客户用途。模型未对任何参与者进行诊断;所有诊断均由医生和其他合格临床专家通过既定审查、检测和临床确认流程做出。

该研究是回顾性的,队列具有异质性,且审查人员对模型置信度未设盲。研究人员未测量节省的时间、成本、临床医生工作量、假阳性工作负担或护理变化。也未系统评估其他形式的遗传变异,如结构变异、重复扩增、深内含子改变或嵌合体。

大型语言模型可能误读上下文或产生看似合理但经不起推敲的解释。因此,每个结果都经过人工裁决和临床确认。模型拓宽了搜索范围并聚焦了后续的人工主导分析;它并未决定应向家庭返回哪些信息或诊断。

本研究使用了去标识化信息,未在批准环境之外使用或传输受保护的健康信息。更广泛的临床部署将需要对所有医疗护理适用的隐私、安全、可审计性和当地法规给予同等关注。模型访问不能替代测序基础设施、遗传咨询、验证性检测或专家判断。

凯瑟琳·布朗斯坦博士,波士顿儿童医院曼顿孤儿病研究中心

艾伦·贝格斯,曼顿孤儿病研究中心主任

未来展望

前瞻性、多中心研究应将LLM辅助再分析与标准实践在诊断率、候选基因发现时间、临床医生工作量、假阳性负担、成本及对护理的影响方面进行比较。版本化的提示、参考文献核查、审计日志和校准的不确定性对于可重复性和安全性至关重要。此类研究仍需要合格临床医生来评估证据、安排适当检测并做出任何诊断或治疗决策。

本研究使用了OpenAI o3 Deep Research。更新的通用模型可以搜索和综合更多科学材料,而GPT‑Rosalind等专用系统则专为更深入的生命科学工作设计,包括变异对蛋白质结构和功能的影响。这些能力未在此测试,需要各自的评估和访问控制。

虽然OpenAI帮助支持了这项初步研究,但曼顿中心将通过OpenAI基金会的资助领导下一阶段工作。该资助将支持该中心更广泛的努力,开发一个平台无关、低成本的遗传学AI辅助工具,帮助临床团队更快速、一致地分析罕见病案例。

长期的研究机会在于探索专家主导的AI辅助再分析是否有助于科学理解跟上发现的步伐。其前景并非AI取代医生的诊断,而是经过仔细评估的研究工具可能帮助专家识别值得调查的证据。对于成千上万的家庭而言,今天未解答的问题不必永远悬而未决。

本文内容采集自官方网站,排版和翻译可能与原页面存在差异。

阅读官方全文