AI行业资讯No.32:医疗智能体MIRA 登上 Nature;谷歌推出辅助诊断工具 AMIE;港中大提出内镜机器人突破方向;国家举办首个医保影像AI大赛
发表日期: 2026年7月23日
1.自主医疗 AI 智能体 MIRA 登上 Nature 正刊,把诊疗做成可执行的 Agent
当前主流医疗AI多为被动问答模式,仅能根据用户输入信息给出答复,缺乏主动交互、分步排查病情与动态调整诊疗方案的能力,无法适配临床循序渐进、迭代优化的诊疗流程,仅能提供基础辅助参考,无法独立落地开展临床诊疗工作。
6月17日,自主医疗AI智能体MIRA(Medical Intelligence for Reasoning and Action)的研究成果刊发于《自然》正刊,打破了传统医疗AI的技术瓶颈。该模型深度复刻临床医师诊疗逻辑,可在标准化模拟电子病历系统中,自主完成问诊查体、开具检查、判读结果、修正诊断、拟定方案、评估住院需求的全流程诊疗工作。
MIRA采用创新多层级技术架构,依托GPT-4o与o1双模型构建核心能力,通过“规划—执行”分层模式运转。其中GPT-4o负责医患交互与工具调用,o1模型专注诊疗关键节点的复杂逻辑规划,搭配医疗工具合集、通用医疗接口与患者模拟系统,形成完整运行体系。
该系统适配通用医疗数据标准,搭建起“观察—决策—执行—反馈—迭代”的诊疗闭环。依托六大权威医学编码体系,MIRA可从超8.5万项临床诊疗选项中筛选最优方案。同时,研究团队搭建了多维度评测体系,建成标准化医疗智能体专业测试平台。
基于574例真实急诊病例模拟测试显示,MIRA诊断准确率达88.9%。在与专科医师的同条件对照测试中,仅依靠患者初始主诉自主研判,其诊断表现持平甚至优于专业医师,诊疗方案贴合临床指南,用药与住院决策安全稳定、专业可靠。
MIRA实现了医疗AI的跨越式升级,实现了医疗AI从“辅助建议”到“自主执行诊疗动作”的跨越式突破,为医疗AI标准化、自主化、规模化的临床落地应用奠定了坚实的技术基础。

链接:https://www.nature.com/articles/s41586-026-10675-5
2.谷歌医疗诊断辅助工具AMIE,让疑难病例鉴别从“大海捞针”变成“精准打击”
当前,基层及普通执业医生处置疑难病例时,容易出现诊断思路局限、鉴别清单不全面、准确率偏低的问题,且传统搜索工具、医学典籍等辅助方式,难以高效支撑复杂病例的诊断决策,限制了诊疗质量提升。
近日,谷歌团队针对临床诊疗场景开展专项优化,研发出智能医疗辅助诊断工具 AMIE(Articulate Medical Intelligence Explorer),既可独立完成疑难病例的病情排查与诊断梳理,也可协同临床医师开展诊疗,具备优秀的医患对话交互能力,为病情研判提供智能化支撑。
AMIE 摒弃通用泛化适配架构,依托两项专属核心技术深度适配医疗场景。一是自主迭代学习技术:可全天候模拟全病种、多科室真实问诊场景,通过结果自动校验、纠错复盘的闭环机制,持续完善罕见病、非典型病症诊疗逻辑,弥补普通 AI 病种覆盖有限、疑难病例判别能力不足的短板。二是渐进式链式推理技术:问诊时分步采集、核验患者病情数据,逐层推导致病诱因,动态优化诊断方案,推理逻辑与资深临床医师诊疗思维高度契合。
在《新英格兰医学杂志》302 例顶级疑难病例测评中,AMIE 独立诊断前十类准确率达 59.1%,远高于无辅助医师的 33.6%;辅助医师诊疗时,可将诊断准确率从 36.1% 提升至 51.7%,表现优于传统搜索引擎。同时,159 例跨国双盲测试证实,其综合推理能力优于市面主流医疗 AI 产品。
待通过多中心真实临床落地测试,充分验证通用性与运行稳定性后,AMIE 将实现常态化临床应用,有效弥合基层医师与专科专家的诊疗能力差距,助力临床实现更精准、优质、高效的医疗诊断服务。

链接:https://www.nature.com/articles/s41586-025-08869-4
3.推理能力将成关键突破,港中大任洪亮团队前瞻内镜手术 AI Copilot 机器人
传统内镜手术机器人仅能被动执行医生指令,机械复刻操作,缺乏自主判断与动态变通能力。面对术中组织变形、突发出血、视野遮挡等复杂紧急场景,这类设备无法自主研判局势、预判潜在风险,难以适配手术动态变化灵活调整操作,临床辅助的局限性较为突出。
6月11日,香港中文大学任洪亮教授团队在《npj Digital Medicine》发表研究,提出推理能力是下一代内镜手术 AI Copilot 机器人的核心突破方向。搭载视觉 - 语言 - 动作(VLA)模型的内镜手术机器人,凭借多步逻辑推理、多模态信息融合与不确定性感知能力,可在医生监督下精准理解手术意图、协同多器械操作、预判组织变化,在复杂术中场景中实现更安全、精准、智能的手术辅助。
该研究明确了新型手术 AI 机器人的四大核心升级能力。一是场景化手术推理能力,可结合手术全程上下文解读指令,将高层诊疗意图转化为规范、安全的实操动作,实现先理解再执行的智能作业模式。二是多模态融合感知能力,可整合各类手术数据,动态甄别、调整信息可信度,适配手术场景多变、视觉信息易失效的行业痛点。三是多器械协同能力,依托智能推理厘清器械、组织与手术任务的关联,有效规避操作风险。四是链式风险预判能力,可提前推演操作结果、预判术中隐患,摆脱传统设备即时被动反应的短板。
未来,医疗行业将重点攻坚模型轻量化、实时化落地,平衡手术效率与资源损耗,推动手术机器人从视觉驱动的自动化操作,迈入推理驱动的智能协作新阶段,助力高端机器人手术提质普及。

链接:https://doi.org/10.1038/s41746-026-02827-8
4.千支队伍同场竞技,全国首个国家级医保影像 AI 识图大赛吹响实战号角
当前,全球AI竞争重心加速转向场景落地,医疗AI赛道竞争愈发激烈。国内医疗影像诊断行业仍存在诸多短板,基层诊疗能力薄弱、疑难病症易出现漏诊误诊,同时行业缺少统一技术标准,算法难以通用。受隐私安全规则限制,医疗数据合规利用难度较大,极大制约了国内医疗AI的规范化发展与国际化进程。
为破解行业发展瓶颈,今年8月至10月,全国首个国家级“AI+影像识别”专业赛事——全国医保影像AI识图大赛正式开赛。赛事聚焦人工智能与医学影像辅助诊断的深度融合,立足真实临床与医保审核场景开展应用比拼,对行业企业创新发展、国内医疗AI出海布局具备重大引领价值。
大赛依据真实临床路径与医保审核规则,设置八大专业赛道,覆盖CT肺癌、肾癌、CTA颅内动脉瘤、MRI脑胶质瘤、前列腺病变、乳腺钼靶、超声甲状腺癌、胸部X光等高发、高误诊病种。赛事搭建超1000P算力平台,保障近千支参赛队伍同台竞技。同时,赛事搭建国家级医疗可信数据空间,归集13.4万例经严格质控的高质量影像数据,面向全行业有序开放。
本次大赛还搭建了完善的产业赋能体系,落地百亿级人工智能产业投资基金、最高2000万元单项产业化扶持资金,配套第二类医疗器械优先审评审批绿色通道,形成“研发—集成—转化—应用”全产业链闭环。
未来,赛事将依托跨境医疗协作网络,推动中国医疗AI算法、质控体系及云平台方案集群出海,实现标准、模式、治理全方位输出,助力中国医学AI标准成为东南亚及海外医疗数字化的重要参考标准。

链接:https://www.nhsa.gov.cn/art/2026/3/19/art_109_19963.html
5.百度开源模型 Unlimited OCR登顶OmniDocBench,一次前向推理读完整本书
当前DeepSeek OCR 等方案虽能大幅压缩文档图像特征,但短板在文字输出阶段。识别长文档时,随着识别内容增多,模型缓存持续膨胀,显存占用上升、识别速度不断下降。多数 OCR 只能分页识别,无法一次性处理完整长文档,图像压缩的性能优势难以充分释放。
6月22日,百度在HuggingFace开源了文档解析模型 Unlimited OCR(无限 OCR)。在标准 32K 上下文下,它首次让 OCR 模型“一口气读完整本书”——不是逐页处理,也不是 for-loop 拆任务,而是一次前向推理直接完成数十页文档解析。
Unlimited OCR 以 DeepSeek OCR 为底座,采用 3B 参数 MoE 混合专家架构,推理仅激活 500M 参数,兼顾性能与效率。模型沿用 DeepEncoder 视觉编码器,高效压缩文档图像,削减输入阶段算力消耗,其核心创新是解码端 R-SWA 参考滑动窗口注意力机制,模拟人类抄书逻辑:文档视觉特征全程留存,已识别文本只保留默认 128token 短时记忆,对早期历史信息进行 “软遗忘”。不同于传统方案,该机制维持缓存容量恒定,不会随输出文本拉长持续膨胀。
在主流基准 OmniDocBench v1.5 上,Unlimited OCR 以 93.23% 的总分取得端到端 SOTA,相较 DeepSeek OCR 高出约 6 个百分点。实测针对论文、教材、PPT、报刊等复杂版式文档,该模型识别精度优于基线模型,支持一次性解析数十页内容,有效降低文本重复问题。当输出长度达到 6000 token 时,其推理速度较基线模型提升 35%,可实现长篇文档连续、稳定的 OCR 识别。
长文档OCR长期受解码端历史缓存负担制约,业内普遍只能逐页解析。Unlimited OCR聚焦解码端创新,为超长上下文文档识别提供了全新技术范式。其对DeepSeek OCR技术的延续迭代,也展现出开源社区在OCR赛道上接力演进的发展态势。

链接:https://huggingface.co/baidu/Unlimited-OCR
6.AI 首次自主攻克 80 年数学难题,三大“非人化”优势攻克最严密的科学堡垒
人类擅长依托既有共识开展渐进式研究,却易受固有学术经验束缚;具备深度推理能力的通用 AI 能够打破思维定式,自主开展大规模试错、跨学科检索与构造性推演,弥补传统数学研究的固有短板。
5月21日,OpenAI 宣布其通用推理模型独立完成原创数学证明,推翻悬置近 80 年的 “平面单位距离猜想”,并提出更优的全新构造方案,这也是 AI 首次独立攻克数学界知名核心公开难题。值得关注的是,该模型并非专用数学系统,没有经过任何定向专项训练,却创新性运用了和组合几何交集有限的代数数论工具。
AI 得以攻克长期悬置的数学难题,根源在于迥异于人类的算力与思维特质,突破传统研究边界。其一,AI 拥有无偏见的全局推理能力。人类常受学术审美与固有直觉影响,倾向遵循经典解题范式;AI 不受思维惯性限制,跳出人类认知盲区,在离散几何、代数数论等交叉较少的方向建立联系,开辟全新解题思路。其二,AI 具备跨领域整合能力。学者大多深耕单一方向,难以跨越知识壁垒,而 AI 能够融汇多学科理论,联通看似割裂的研究领域,应对复杂跨学科难题。其三,AI 拥有持续稳定的算力,可不间断完成高强度推演,驾驭冗长复杂的逻辑链条,不受精力瓶颈制约,把耗费数十年的研究工作缩短至数十小时。
目前,AI早已超越辅助工具范畴,可以自主生成原创思路与完整数学证明。未来数学研究将构建人机协同新范式,借助 AI 突破人类认知与算力上限,拓展科研边界。在合理规范引导下,AI 将赋能基础数学探索,维系数学开放、求真的学科底色。

链接:https://cdn.openai.com/pdf/74c24085-19b0-4534-9c90-465b8e29ad73/unit-distance-proof.pdf
7.GLM-5.2 开源即适配,昇腾三大 DSA 融合算子驱动长序列训练性能跃升
长序列大模型训练普遍存在显存、算力瓶颈,传统算法计算量随文本长度暴涨,难以适配超长篇内容。DSA 优化算法通过筛选关键文本片段大幅降低计算压力、几乎不损失效果,但落地存在硬件难题。
6月17日,智谱发布最新旗舰大模型 GLM-5.2,沿用 7440 亿参数 MoE 架构,新增 High 与 Max 两种慢思考推理模式,提供强大的编码能力与原生 100 万 token 超长上下文。模型权重开源后,昇腾 MindSpeed LLM “天级”完成适配,CANN 实现 DSA 稀疏注意力的昇腾算子深度优化。
围绕 DSA 全训练链路,在昇腾平台研发三大融合算子,贯穿索引筛选、稀疏注意力、反向损失计算全流程。优化遵循两条主线:通过数据分片、地址聚合减少离散数据重复搬运;依托流水预加载实现硬件单元并行执行,消除算力空转。实测 4K 序列场景下显存占用下降 27%,迭代耗时显著缩短。
三款算子各司其职:LightningIndexer 融合算子加速关键 token 筛选,大幅削减时延与数据搬运量;SparseFlashAttention 算子优化稀疏注意力运算,提升带宽利用率、压低显存峰值;SparseLightningIndexerGradKLLoss 融合算子整合反向传播与损失计算,无需存储海量中间张量,大幅降低长序列反向传播显存开销。
MindSpeed LLM是昇腾AI生态中的核心技术支撑,专为大规模语言模型设计,具备强大的计算性能与灵活易用性的工程化能力。国产大模型“开源即支持”,正让软硬件协同的长序列训练加速走向可用。


