海光深入医院场景,助力医疗大模型跑进临床

海光深入医院场景,助力医疗大模型跑进临床

一张ICU病床,一天大约会产生10万条数据。在生死时速的真实临床现场,医生每天的诊疗,本质上就是在这片庞杂的数据汪洋中求索。

近年来,AI在医疗场景的布局按下了加速键,尤其是自2025年初,DeepSeek的爆火,激发了国内上百家三级医院陆续完成了大模型的本地化部署。然而,真正能将其嵌入核心诊疗闭环的却屈指可数。

事实上,AI进入医疗领域,模型早已不是短板,为什么真实的临床路径仍然亟待解决?

这是因为在真实的医疗场景中,医疗决策极度依赖可靠性而非单纯的生成能力。当系统需要并发处理成百上千份数万字的重症病历时,系统会不会崩溃、患者隐私会不会泄露,与模型的基础能力同样重要。这种既要快、又要稳、还要保证安全的特殊长场景,共同让医疗AI的下半场战事,竞争内核已经从早期的拼参数、拼跑分,全面交棒给了底层算力的稳定性与系统工程能力。

“壹问”入局,解构临床级AI的算力“阿喀琉斯之踵”

9月22日,厦门大学附属第一医院联合厦门大学、中科紫东太初、海光信息推出全国首个通专一体医疗模型——“壹问”,并同步揭牌了“数智医疗临床转化研发中心”与“医疗人工智能与应用创新中心”两大联合实验室。

据了解,“壹问”采用通用医学基座、专科子模型和循证校验层组成的通专一体架构。

所谓“通专一体”,即用一个掌握全科医学知识、具备自然语言交互能力的“通用医学基座”打底,去统一调度内科、外科、影像等多个“专科子模型”。遇到基础问诊,基座直接作答;遇到疑难病灶,基座调用专科模型输出结论,再进行多源融合,以此兼顾通识广度与专科精度。

“通专一体”架构的出现,本质是为了应对真实临床级医疗AI的三大计算特征:多模态、长流程、持续迭代。而这三大特征,恰恰是对底层算力最严苛的拷问。

首先是“多模态”。临床诊断从来不是单纯的文本游戏,而是电子病历、检验报告、超声与核磁影像的混合输入,这要求算力底座具备极高的并行处理与异构数据吞吐能力。

其次是“长流程”。一次诊疗涵盖了从预问诊、查房、病程记录到出院随访的漫长周期,大模型(通才中枢)需要不断地进行任务编排、工具调用和知识检索,逻辑与数据密集型任务。

最后是“持续迭代”,医学指南在不断更新,模型需要利用新增的院内数据进行LoRA增量微调,这要求算力集群必须在不干扰为多科室LoRA并行微调、训练区/推理区隔离。

这种复杂的特征直接导致了算力负载的“分裂”。如果无脑堆叠传统的加速卡,在真实医疗Agent智能体的长流程调度中,大量的算力会被浪费在任务等待上,导致CPU端的处理延迟甚至可能高达90%以上。特别是在高风险的辅助决策中,必须能够引用溯源并由硬规则兜底,这进一步加剧了逻辑计算的重压。算力架构的短板,在临床现场会被无限放大。

海光CPU+DCU,铸造完整的自主算力生命线

面对“多模态、长流程、持续迭代”的复合挑战,行业需要的不再是通用算力的暴力拼接,而是定制化的底层重构。海光提出的“Agent to Token开放计算架构”,正是基于此形成了一套完整的自主算力支撑体系。

这套架构核心逻辑在于,让CPU和DCU各司其职,从物理层面消解算力瓶颈。

在海光量身定制的院内私有化算力集群中,针对医疗的“长流程”与安全隔离需求,海光C86 CPU接管了系统的指挥权。它专门承担医疗数据脱敏清洗、病历结构化预处理、集群资源调度,以及最关键的与院内HIS(医院信息系统)/EMR(电子病历系统)的复杂对接。这是医疗系统不可或缺的防线。

针对“多模态”与“持续迭代”的重负载,DCU加速卡则专注提供并行算力输出,承担大模型预训练、LoRA增量微调以及高并发临床推理。两者结合,形成了一个内生闭环的完整算力底座。

与此同时,为了降低医疗机构替换算力的阵痛,海光依托其DTK开发工具链修筑了生态护城河。这套软件栈不仅全栈兼容主流大模型开发框架,还完成了算子级适配,CUDA核心组件API兼容性除硬件与编译器特性外,接口功能覆盖率达到100%,使得医院原系统的模型算法代码能够以极低的改动成本实现平滑迁移。

深度下场,海光在“壹问”落地中的工程化推进

算力底座的价值,不能仅停留在架构图上,必须接受真实机房的检验。在厦门大学附属第一医院“壹问”大模型的联合研发与落地过程中,海光不仅是算力底座的提供者,还与医院信息科、厦大医学院算法团队组成了专项攻关组,直接嵌入了数据处理、模型训练、微调迭代、推理部署等核心环节。

医学语料的一个显著特点是专业术语密集、符号复杂,如果单纯依靠堆砌算力,极易导致系统陷入低效的计算泥潭。为此,海光团队针对性地从底层切入,优化了混合精度训练算子与分词器的执行效率,并动态调整梯度更新策略,硬生生拉升了海量医学语料的训练收敛速度,大幅缩短了基座模型的训练周期。

到了推理部署阶段,门诊高峰期的高并发是真正的试金石。海光完成了INT8/FP16混合量化压缩,在严控精度损失的前提下大幅降低显存占用,满足门诊端多终端实时调用的低延迟需求。

同时,“壹问”大模型采用全院内本地化部署模式,所有医疗原始数据、模型训练推理全程不离开医院内网。团队下场完成了算力集群与医院HIS、EMR、PACS等核心业务系统的接口联调,实现数据调用、模型输出与临床工作流的无缝衔接;并搭建数据安全隔离机制,算力集群划分为训练区与推理区,实现数据权限分级管控,全程数据院内闭环,不对外流转

这种底层的工程化成果,不仅在厦门落地开花,也在更多的医疗场景中发光发热。在浙江大学医学院附属邵逸夫医院牵头的西湖数智病理平台,海光底层架构支撑了术中冰冻切片1秒级的病灶识别。四川省人民医院基于海光算力部署了DeepSeek大模型用于预问诊。在中国医学科学院阜外医院,单机8卡海光DCU运行235B参数模型,在模拟32并发和128并发首token时间被压缩为1.8s和6.1s。

算力的基石,重塑医疗AI下半场

当大模型在医疗行业的战事步入深水区,“百模大战”的喧嚣已经落幕。

真实世界里的三甲医院,真正需要的是一个能真正扛住门诊早高峰、绝不泄露患者隐私、永不宕机的“数字同事”。医疗AI之争,表面上看是算法的较量,底层实则是算力调度、稳定性与系统工程能力的比拼。

谁能以自主可控的底层算力托底,在极端的并发与严苛的合规中构筑起一条坚不可摧的生命线,谁就能拿到医疗智能化下半场的入场券。而在这条路上,那些隐身于医院机房深处、日夜轰鸣的算力底座,早已不再是冷冰冰的硬件,而是决定中国医疗AI能走多远、走多稳的真正基石。

发表评论

您的电子邮箱地址不会被公开。 必填项已用*标注