Evidence OS医学证据与科研服务
Evidence OS前沿资讯
FRONTIERS

前沿资讯

每日关注医学证据、临床 AI 与健康决策的重要进展。读清研究发现、对患者和医生的意义,以及仍待验证的地方。

每日简报 · 整理日期
npj Breast Cancer|回顾性临床试验数据研究

AI提取病历数据时,也应告诉审核者原文在哪里

研究比较人工录入与AI从电子病历提取乳腺癌临床试验数据。系统为每个变量保留原文定位,便于研究人员复核。

对健康与医疗的意义

对医生和研究客户而言,可定位到原文的结果更容易发现误读、处理分歧并留下纠错记录;这是提高效率之外的重要安全条件。

研究边界与出处

研究来自一家医院、一个癌种且为回顾性比较;尚未证明可在不同医院稳定运行,也未证明降低成本或改善患者结局。

Artificial intelligence for clinical data extraction from EHRs in breast cancer trials: the MIRROR study
npj Artificial Intelligence|对抗性基准研究

医学AI引用了文献,也可能被文献的呈现方式带偏

研究显示,向检索库加入少量特制文档,就可能改变医学AI对相同事实的表达重点,并把回答导向特定产品或立场。

对健康与医疗的意义

患者和医生不能只看“有没有引用”,还需知道来源是谁、是否多方一致、是否存在商业偏向,以及结论对替换来源是否敏感。

研究边界与出处

这是实验室基准攻击,不代表现实临床系统已经发生同样问题;对实际攻击频率、患者伤害和最佳防御尚无临床证据。

FramePoison: attacks on medical RAG that target framing, not just facts
npj Digital Surgery|范围综述

真正进入手术流程的AI,公开临床证据仍很少

研究者从3,020条记录中仅找到5项符合真实术中决策支持标准的研究;只有一项已完成,而且仅分析5名患者。

对健康与医疗的意义

患者、外科医生和医院不应把技术演示、注册中的试验或“医生保留最终决定”理解为已证明安全有效;采用前仍需审计、责任和结局评价。

研究边界与出处

研究范围仅限术中AI,纳入数量少且差异大;提出的治理评分表尚未经过外部验证。

Ethical considerations for intraoperative implementation of artificial intelligence clinical decision support systems: a scoping review
npj Digital Medicine|探索性多中心随机试验

AI辅助远程康复没有改善主要运动结局

120名早期帕金森病患者被随机分配到不同训练时长,最终分析71人。三个月时主要运动评分在各组间没有显著差异;研究未记录到跌倒或其他不良事件。

对健康与医疗的意义

这项阴性结果提醒患者和医生:使用了AI、甚至进行了随机试验,都不代表疗效已经成立;主要终点和合适对照比事后发现更重要。

研究边界与出处

失访较多,且没有常规照护或非AI对照;研究比较不同训练时长,不能单独判断AI是否带来额外价值。

AI-assisted telerehabilitation in early Parkinson’s disease: a multicenter, randomized, multi-arm comparative trial
每日简报 · 整理日期
英国政府与MHRA · 医疗AI监管更新

医疗AI获批后,也需要持续证明自己仍然安全有效

英国政府10月6日接受全部44项医疗AI监管建议,并启动以上市后监测和生命周期监管为重点的新一阶段AI Airlock。

对健康与医疗的意义

患者、医生和采购方未来需要知道的不只是一个系统是否获批,还包括升级后是否重新验证、真实使用中是否持续监测以及问题如何被纠正。

研究边界与出处

目前是政策与监管沙盒安排,尚不是已实施完成的法律,也未证明患者结局改善。

Government backs recommendations of NHS doctors-led AI Commission
npj Digital Medicine · 随机临床试验

AI问诊可以更完整,但医生查体和综合判断仍不可替代

172名眼科患者的随机试验中,AI问诊获得更高的病史完整性、耐心和共情评分,但耗时更长;加入眼部体征后,医生的诊断表现改善更多。

对健康与医疗的意义

较合理的使用方式可能是让AI先标准化收集信息,再由医生完成查体、判断和责任确认,而不是让AI独立完成整个诊疗流程。

研究边界与出处

研究来自单一眼科医院,样本较小,未评价长期结局或真实医疗安全性。

Standardized pre-consultation by a large language model agent vs ophthalmology residents: a randomized clinical trial
medRxiv · 未经同行评议的真实世界研究稿件

医生修改AI病历的地方,可以帮助发现系统变化

一项26.8万次门诊就诊研究发现,临床概念层面的修改可大规模识别具有临床意义的编辑,并监测系统推广前后的变化。

对健康与医疗的意义

对医院而言,记录医生修改了什么、为什么修改,可能比只统计节省时间更能发现AI病历系统的质量变化。

研究边界与出处

研究尚未同行评议,来自单一机构;编辑并不等同错误,也尚未证明减少患者伤害。

A Framework to Monitor Editing of Artificial Intelligence-Generated Medical Documentation
npj Digital Medicine · 系统性证据调查

AI医疗软件已经获批,也可能缺少公众可核查的性能资料

对77个获CE标志或FDA授权的病理及血液形态AI设备进行调查,仅39%找到公开的设备特异性性能证据。

对健康与医疗的意义

医院和客户不能只看“是否获批”,还应核对公开性能数据、适用人群、评价指标和本地验证情况。

研究边界与出处

没有找到公开证据不代表监管机构没有审查数据,也不能据此认定产品无效或不安全。

Availability of performance evidence of approved AI diagnostic software in pathology and hematology morphology
每日简报 · 整理日期
JMIR · 随机试验系统综述与 Bayesian network meta-analysis

医院预警系统更复杂,并不代表患者一定获益

9月24日发表的综述纳入28项随机试验;在严格数字监测证据中,电子规则监测、预测模型和连续生理监测均未明确降低死亡或ICU转运。

对健康与医疗的意义

医院、医生和患者需要关注的不只是模型是否能预警,还包括警报由谁接收、能否及时行动,以及最终是否改善重要结局。

研究边界与出处

证据网络稀疏、缺乏主动策略头对头比较,可信区间仍包含获益与伤害;总体证据可信度极低。

Clinical Surveillance Technologies in Nonintensive Care Unit Hospital Settings: Systematic Review and Bayesian Network Meta-Analysis of Randomized Trials
医院公告 · 个体化临床 AI

慢性肾病预测,开始连接患者数据与个体化随访

Hospital Clínic Barcelona 10 月 5 日介绍 Renal-Trust:关联安全临床数据,分析超过 4,000 名患者的信息,探索识别肾病快速进展风险与解释预测因素。获奖事件发生于 10 月 1 日。

对健康与医疗的意义

对患者与医生,有价值的方向是更早识别需要密切随访的人群,并理解风险依据;这一潜在用途仍需要实际流程评价。

研究边界与出处

院方项目公告没有提供前瞻性比较试验,不能据此确认改善患者结局。

医院公告 · 个体化临床 AI
Frontiers · 系统综述

AI 抗生素决策:进入临床,还需要更强证据

9 月 30 日的系统综述纳入 10 项研究,仅 3 项达到实际临床部署。部分研究报告有利信号,但死亡结局证据确定性低,其他重要结局很低;研究差异使统计合并不适宜。

对健康与医疗的意义

医生与医院采购方应分别考察模型表现、真实流程使用和患者结局,并明确适用感染与人群。

研究边界与出处

不能据此证明所有 AI 抗生素系统有效,仍需前瞻性多中心评价。

Frontiers · 系统综述
JMIR · 回顾性开发验证

海量安全事件报告,怎样优先找到需要调查的问题?

9 月 29 日研究使用加拿大一个学术医疗系统的 101,239 份患者安全报告,回顾性评价发现文本排序模型能更好地把高严重性事件排到调查队列前面。

对健康与医疗的意义

对医院与患者安全团队,潜在价值是使有限调查资源聚焦重要事件;实际工作中是否实现这一价值仍需验证。

研究边界与出处

回顾性排名表现不等于已经减少患者伤害;仍需前瞻性流程评价和跨机构验证。

JMIR · 回顾性开发验证
每日简报 · 整理日期
npj Digital Medicine · 观点

临床 AI 的建议,怎样才能查得清楚?

一篇医学观点文章提出:涉及医疗行动的主张,需要有充分证据、能够精确核验的来源,并按照患者、医生等不同审阅者的需要呈现。

对健康与医疗的意义

患者可以追问“这项建议依据哪项研究,是否适合我的情况”;医生需要能定位到支持具体建议的原文和限制。清晰的证据链,有助于双方讨论理由、风险与不确定性。

研究边界与出处

2026-09-19 发表的观点文章,提出呈现与核验框架;尚未通过临床研究证明患者获益。

Toward reviewable medical evidence synthesis for care delivery
Scientific Reports · 基准研究

医学 AI 怎样继续寻找尚缺的证据?

MRER 多代理框架利用已找到的证据,识别尚未解决的问题,再进行针对性检索。在三个医学问答基准测试中,研究报告的平均准确率为 70.68%。

对健康与医疗的意义

面对共病或复杂健康问题,患者与医生需要知道:哪些问题已有依据,哪些仍缺证据,以及补充检索找到了什么。明确证据缺口,更便于判断是否需要进一步查证或专业复核。

研究边界与出处

2026-09-19 发表,2026-09-16 接收;当前为出版方早期公开版本。结果来自医学问答基准,尚不能证明真实临床获益。

Retrieval-augmented multi-agent framework for evidence-centric medical reasoning
Nature Medicine · 诊断基准研究

准确率之外,还要看 AI 能回答多少病例。

一项本地临床代理研究通过一致性阈值筛选出 49.4% 的病例;在这部分被保留的病例中,诊断准确率为 98.9%。两个数字需要一起理解。

对健康与医疗的意义

评估临床 AI 时,需要同时了解准确率、能够覆盖的人群,以及何时交由专业人员处理。清楚说明适用范围与转人工条件,有助于合理使用,也能避免把部分病例的表现理解为所有病例的表现。

研究边界与出处

2026-09-15 发表。研究基于模拟和诊断基准,尚未证明医院日常使用效果或患者结局改善。

On-premise medical AI agents for reliable clinical decision-making