AI提取病历数据时,也应告诉审核者原文在哪里
研究比较人工录入与AI从电子病历提取乳腺癌临床试验数据。系统为每个变量保留原文定位,便于研究人员复核。
对医生和研究客户而言,可定位到原文的结果更容易发现误读、处理分歧并留下纠错记录;这是提高效率之外的重要安全条件。
研究边界与出处
研究来自一家医院、一个癌种且为回顾性比较;尚未证明可在不同医院稳定运行,也未证明降低成本或改善患者结局。
每日关注医学证据、临床 AI 与健康决策的重要进展。读清研究发现、对患者和医生的意义,以及仍待验证的地方。
研究比较人工录入与AI从电子病历提取乳腺癌临床试验数据。系统为每个变量保留原文定位,便于研究人员复核。
对医生和研究客户而言,可定位到原文的结果更容易发现误读、处理分歧并留下纠错记录;这是提高效率之外的重要安全条件。
研究来自一家医院、一个癌种且为回顾性比较;尚未证明可在不同医院稳定运行,也未证明降低成本或改善患者结局。
研究显示,向检索库加入少量特制文档,就可能改变医学AI对相同事实的表达重点,并把回答导向特定产品或立场。
患者和医生不能只看“有没有引用”,还需知道来源是谁、是否多方一致、是否存在商业偏向,以及结论对替换来源是否敏感。
这是实验室基准攻击,不代表现实临床系统已经发生同样问题;对实际攻击频率、患者伤害和最佳防御尚无临床证据。
研究者从3,020条记录中仅找到5项符合真实术中决策支持标准的研究;只有一项已完成,而且仅分析5名患者。
患者、外科医生和医院不应把技术演示、注册中的试验或“医生保留最终决定”理解为已证明安全有效;采用前仍需审计、责任和结局评价。
研究范围仅限术中AI,纳入数量少且差异大;提出的治理评分表尚未经过外部验证。
120名早期帕金森病患者被随机分配到不同训练时长,最终分析71人。三个月时主要运动评分在各组间没有显著差异;研究未记录到跌倒或其他不良事件。
这项阴性结果提醒患者和医生:使用了AI、甚至进行了随机试验,都不代表疗效已经成立;主要终点和合适对照比事后发现更重要。
失访较多,且没有常规照护或非AI对照;研究比较不同训练时长,不能单独判断AI是否带来额外价值。
英国政府10月6日接受全部44项医疗AI监管建议,并启动以上市后监测和生命周期监管为重点的新一阶段AI Airlock。
患者、医生和采购方未来需要知道的不只是一个系统是否获批,还包括升级后是否重新验证、真实使用中是否持续监测以及问题如何被纠正。
目前是政策与监管沙盒安排,尚不是已实施完成的法律,也未证明患者结局改善。
172名眼科患者的随机试验中,AI问诊获得更高的病史完整性、耐心和共情评分,但耗时更长;加入眼部体征后,医生的诊断表现改善更多。
较合理的使用方式可能是让AI先标准化收集信息,再由医生完成查体、判断和责任确认,而不是让AI独立完成整个诊疗流程。
研究来自单一眼科医院,样本较小,未评价长期结局或真实医疗安全性。
一项26.8万次门诊就诊研究发现,临床概念层面的修改可大规模识别具有临床意义的编辑,并监测系统推广前后的变化。
对医院而言,记录医生修改了什么、为什么修改,可能比只统计节省时间更能发现AI病历系统的质量变化。
研究尚未同行评议,来自单一机构;编辑并不等同错误,也尚未证明减少患者伤害。
对77个获CE标志或FDA授权的病理及血液形态AI设备进行调查,仅39%找到公开的设备特异性性能证据。
医院和客户不能只看“是否获批”,还应核对公开性能数据、适用人群、评价指标和本地验证情况。
没有找到公开证据不代表监管机构没有审查数据,也不能据此认定产品无效或不安全。
9月24日发表的综述纳入28项随机试验;在严格数字监测证据中,电子规则监测、预测模型和连续生理监测均未明确降低死亡或ICU转运。
医院、医生和患者需要关注的不只是模型是否能预警,还包括警报由谁接收、能否及时行动,以及最终是否改善重要结局。
证据网络稀疏、缺乏主动策略头对头比较,可信区间仍包含获益与伤害;总体证据可信度极低。
Hospital Clínic Barcelona 10 月 5 日介绍 Renal-Trust:关联安全临床数据,分析超过 4,000 名患者的信息,探索识别肾病快速进展风险与解释预测因素。获奖事件发生于 10 月 1 日。
对患者与医生,有价值的方向是更早识别需要密切随访的人群,并理解风险依据;这一潜在用途仍需要实际流程评价。
院方项目公告没有提供前瞻性比较试验,不能据此确认改善患者结局。
9 月 30 日的系统综述纳入 10 项研究,仅 3 项达到实际临床部署。部分研究报告有利信号,但死亡结局证据确定性低,其他重要结局很低;研究差异使统计合并不适宜。
医生与医院采购方应分别考察模型表现、真实流程使用和患者结局,并明确适用感染与人群。
不能据此证明所有 AI 抗生素系统有效,仍需前瞻性多中心评价。
9 月 29 日研究使用加拿大一个学术医疗系统的 101,239 份患者安全报告,回顾性评价发现文本排序模型能更好地把高严重性事件排到调查队列前面。
对医院与患者安全团队,潜在价值是使有限调查资源聚焦重要事件;实际工作中是否实现这一价值仍需验证。
回顾性排名表现不等于已经减少患者伤害;仍需前瞻性流程评价和跨机构验证。
一篇医学观点文章提出:涉及医疗行动的主张,需要有充分证据、能够精确核验的来源,并按照患者、医生等不同审阅者的需要呈现。
患者可以追问“这项建议依据哪项研究,是否适合我的情况”;医生需要能定位到支持具体建议的原文和限制。清晰的证据链,有助于双方讨论理由、风险与不确定性。
2026-09-19 发表的观点文章,提出呈现与核验框架;尚未通过临床研究证明患者获益。
MRER 多代理框架利用已找到的证据,识别尚未解决的问题,再进行针对性检索。在三个医学问答基准测试中,研究报告的平均准确率为 70.68%。
面对共病或复杂健康问题,患者与医生需要知道:哪些问题已有依据,哪些仍缺证据,以及补充检索找到了什么。明确证据缺口,更便于判断是否需要进一步查证或专业复核。
2026-09-19 发表,2026-09-16 接收;当前为出版方早期公开版本。结果来自医学问答基准,尚不能证明真实临床获益。
一项本地临床代理研究通过一致性阈值筛选出 49.4% 的病例;在这部分被保留的病例中,诊断准确率为 98.9%。两个数字需要一起理解。
评估临床 AI 时,需要同时了解准确率、能够覆盖的人群,以及何时交由专业人员处理。清楚说明适用范围与转人工条件,有助于合理使用,也能避免把部分病例的表现理解为所有病例的表现。
2026-09-15 发表。研究基于模拟和诊断基准,尚未证明医院日常使用效果或患者结局改善。