近几个月,AI在神经外科的进展相当亮眼,不少医生和研究者已经开始尝试用AI去读懂手术视频、辅助实际操刀。今年5月,英国外科团队完成了全球首例由AI实时辅助的脑部手术——系统术中实时分析内镜画面、锁定隐藏的血管和神经,帮一名垂体瘤患者把肿瘤切得很干净,患者如今完全康复,视力也明显好转。到了今年6月,《手术前沿》刊出一篇论文,专门在大脑中动脉瘤夹闭术上检验了AI"预判下一步操作"的本领,INC罗顿教授(Michael T. Lawton)也参与了这项研究。

三种模型同台比拼
大脑中动脉分叉处动脉瘤的夹闭,本就是极考验功力的神经外科手术。它没有一成不变的流程——每个患者的血管走形都不一样,台上情况随时可能变,步骤先后也得跟着调整。能不能提前判断"下一步该做什么",直接牵动手术的效率和安全,也关系到年轻医生的带教。
研究团队找来同一位术者做的25例没出并发症的大脑中动脉分叉动脉瘤夹闭手术,18例拿来训练,7例留作独立测试。他们用Transformer模型,喂入此前60秒的显微手术视频加上人工标好的步骤,去猜随后60秒里可能出现的夹闭步骤。所有病例都被标成12个标准动作,比如外侧裂分离、M4到M2分支解剖、M1段准备、动脉瘤颈分离、动脉瘤游离、近端控制、夹闭、闭塞确认等。

三种配置被拿来对比:CNN-LSTM负责从视频里提取视觉特征,Transformer再把这些特征和流程上下文合在一起,推测后续步骤。只看视频的模型,先用预训练CNN-LSTM抠出每帧画面特征,再送进Transformer猜步骤;只看步骤标签的模型,不碰视频,直接把人工标好的真实步骤喂给Transformer,靠已有流程和上下文往后推;多模态模型则把视频特征和人工步骤标签拼到一起再进Transformer。
在7例独立测试里,多模态模型整体最出色。
| 模型 | 平均准确率 | 加权F1值 |
| 仅视频模型 | 47.7% | 44.7% |
| 仅步骤标签模型 | 60.6% | 47.7% |
| 多模态模型 | 68.3% | 67.3% |
准确率看的是预测对的比例,召回率看的是真实情况被抓住的比例,F1则是两者调和平均。比起单用视频或单用既往步骤,多模态同时吃进两类信息,既抓得住整体进程,也留得住局部画面线索,所以流程预测更准,时间对得最齐,整体步骤顺序也保得最好。仅视频模型往往精确率高、召回率低——说明它猜的多数没错,却漏掉不少真实动作;仅标签模型在长而结构复杂的步骤上表现好,碰到短步骤就力不从心。

不同测试案例中预测手术步骤序列与真实序列的时间对齐情况。颜色表示不同的手术步骤,便于比较不同模型配置下的预测步骤时间、过渡方式及整体序列一致性。
步骤换来换去,预测就变难
当AI去猜"下一分钟"时,任务并不总一样:有时该接着做当前步骤,有时要切到别的步骤,有时一分钟里甚至要预判好几个步骤。难度也分高低——判断"继续当前步骤"多半靠识别流程稳不稳,判断"步骤要变"则得捕捉正在起变化的苗头。研究者把每个60秒预测窗是否落在同一步骤内做了量化。
结果,接近一半的预测窗口至少跨过1道步骤分界,多模态的帧级准确率做到68.3%;当窗口恰好跨过2道分界,准确率掉到50.9%;一旦跨过3道或更多步骤,准确率只剩42.0%。也就是说,预测窗口内步骤切换越频繁,猜准就越难。
难点与挑战
这项研究初步证明了AI预判手术步骤可行,但离真正上临床还缺一套完整的自动化链路。它用的是人工标好的真实步骤标签,可真实系统里,如果前端对当前步骤认错了,误差会一路传到后面,拉低整体表现。
另外,AI在神外落地还要过数据这一关:患者肯不肯让录手术视频?手术显微镜配不配得上高清摄像?视频质量能不能核验?生成的数据安不安全、脱没脱敏?存储设备扛不扛得住海量影像?每一例都得有神经外科专业背景的人审和标,这让数据集建设又慢又难摊大。放到脑血管手术上,这些坎更明显——这类手术标准化程度本来就低,复杂动脉瘤和不同血管区域还会带来更多差异。
结语
这项研究说明,在受控条件下,AI确实能预判大脑中动脉瘤夹闭术接下来一分钟的步骤,而把视觉信息和既往步骤揉在一起的多模态模型最拔尖。作者也坦承,既往步骤目前还得靠人手标注,所以从自动识别到自动预测的全链路还没打通。往后AI要真正进手术室,还得在更大量、更多样的病例上再验证。

参考文献:On, T. J., Lawton, M. T., et al. (2026). Predicting future surgical steps during MCA aneurysm clipping using a multimodal transformer. Frontiers in Surgery, 13, Article 18277
常见问题
问:AI现在能替医生做手术吗?
答:还不行。这项研究只让AI"预判下一步",不是动手操作,而且目前步骤标签还得人工标。真正上临床前,自动化链路和更大样本验证都还没完成。
问:为什么多模态模型最准?
答:它同时吃了视频画面特征和人工步骤标签两类信息,既看得到整体进程,也抓得住局部细节,时间对得最齐,所以平均准确率68.3%、加权F1值67.3%,都高过单看视频或单看标签的模型。
问:预测准确率68.3%算高吗?
答:在"猜下一分钟步骤"这个任务上算不错,但仍有约三成猜错。而且步骤切换越频繁越难——跨3道以上分界时准确率掉到42.0%,说明还远没到可靠替代人的程度。
问:这项研究跟Lawton教授什么关系?
答:Lawton教授(Michael T. Lawton)是这项多模态Transformer研究的参与者之一,论文也列了他的名。他是INC旗下脑血管领域的专家。
问:普通人能从这篇得到什么提醒?
答:AI辅助外科是真实在走的方向,但当前仍处研究阶段、离普及很远。真要手术,决策还是得靠主刀医生和正规医院的评估,别被"AI"二字带偏。

胶质瘤
垂体瘤
脑膜瘤
脑血管瘤
听神经瘤
脊索瘤

沪公网安备31010902002694号