欢迎访问智慧医疗网 | 网站首页
 
当前位置:首页 > 研究 > 行情

司南中文医疗大模型评测基准MedBench 5.0上新,超31万次评测持续筑牢安全防线

发布时间:2026-08-03 来源:上海人工智能实验室 浏览量: 字号:【加大】【减小】 手机上观看

打开手机扫描二维码
即可在手机端查看

近日,中文医疗大模型评测基准MedBench升级至5.0版本。本次升级中,上海人工智能实验室(上海AI实验室)科研团队联合广州实验室、广州医科大学附属第一医院钟南山院士,复旦大学附属中山医院葛均波院士团队等顶尖力量,共同构建专科化评测体系,首创医疗原子技能评测范式,实现AI模型幻觉全维度校正,持续筑牢医疗AI安全防线。


MedBench是国内首个原生医疗垂直评测体系,也是上海市委网信办、上海市卫健委指定前置医疗AI应用技术评测载体。


自2024年首次发布以来,MedBench累计服务近12万用户,完成超31万次医疗大模型评测,支撑6项国家级与省级AI赛事。依托MedBench,上海AI实验室于2025年牵头成立医学人工智能评测联盟,现有500余家顶尖医疗机构、权威行业组织和领先科技企业参与,成为我国医疗人工智能测评与验证领域的核心力量。


  • MedBench官网:https://medbench.opencompass.org.cn/home

构建医疗AI全生命周期评测闭环

专业、公正、开放的评测体系是确保AI安全、高效发展的关键。上海AI实验室正积极打造面向通用人工智能时代的创新开放评测体系司南(OpenCompass),并已构建覆盖通用大模型、科学智能、安全可信、具身智能、AI计算系统、行业应用等方向的 “六位一体” 全景评估范式。

MedBench作为司南体系下聚焦医疗领域的评测基准,致力于打造一个科学、公平且严谨的中文医疗大模型评测体系及开放平台。迭代至MedBench 5.0,该体系已构建起“8+1”医疗人工智能评测架构,在垂直定位、评测维度、数据规模、技术范式、安全基石、专科场景、产业赋能、生态影响八大维度实现全面领跑。以上海市医疗大模型应用检测验证中心为核心载体,平台形成了“备案协同、评测准入、伦理审查、落地追踪、整改复测、标准输出”一体化的医疗生成式人工智能治理范式。

微信图片_2026-08-02_194357_596.png

在此基础上,MedBench 5.0搭建了覆盖医疗AI全生命周期的评测闭环:事前准入环节开展资质核对与基模甄别,从源头把控模型基础能力与合规底线;事中评测环节基于评测基准与技术,实施全维度安全攻防测试与临床场景性能校验,全面探测模型能力边界与潜在风险;事后落地环节持续跟踪应用表现并开展迭代复测,保障医疗AI上线后持续安全可靠。

从静态问答到过程化评测的技术跃升

上述全生命周期治理评测闭环的落地,依赖于评测技术的革新。MedBench 5.0突破传统静态问答评测的局限,创新构建动态化、过程化、幻觉感知的评测新范式,力求全方位还原真实临床诊疗的决策逻辑与风险特征。此次技术升级围绕测什么,怎么测,以及如何呈现三个层面展开。

在评测内容层面,平台搭建了“临床认知应答”与“医疗原子技能”双维度评测框架。其中,认知应答评测涵盖13个子方向,全面评估大语言模型、全模态大模型与医疗智能体的临床认知能力;同时聚焦多模态真实场景,与京东健康共建多模态真实线上问诊测评MedRealMM及医学3D影像问答测评Med3DVQA等基准。医疗原子技能评测围绕数据智能体、检索增强生成智能体、深度研究、安全红队测试四大核心任务,配套自主研发的评测沙箱与一体化工具链,实现模型执行能力的系统性评估。全体系共覆盖63项细分临床评测任务,依托近100万条高精度专业评测试题构建权威评测标尺。

微信图片_2026-08-02_194401_176.png

在评测方式层面,MedBench 5.0首创Agent-as-Judge智能体评测引擎架构,突破传统大模型评测中存在的评估主观性、表层推理及结果不稳定等局限,将评估系统升级为具备自主规划、工具调用、迭代纠错能力的智能评估体系,有效提升评测结果的可解释性与权威性。

在评测呈现层面,平台同步推出医疗大模型竞技场板块,常态化围绕幻觉校正等核心短板开展专项评测,基于真实人机对话交互与Elo评分机制量化输出模型能力排名。配套的专属评测报告与错题分析模块,通过多维雷达图呈现模型能力差异,并支持错题溯源、场景复盘与问题解析,为模型迭代优化提供精准数据支撑。

微信图片_2026-08-02_194404_555.png

深耕专科应用,贴合真实临床应用需求

评测技术的突破最终需服务于临床实际价值。针对通用评测难以适配专科精细化需求的行业痛点,MedBench设立专科专精评测赛道,持续联合全国专科优势医疗机构、高等院校与科技企业共建专科评测体系。MedBench 5.0已落地8大细分专科标杆挑战赛事,实现多专科、全场景、全流程能力覆盖。从功能类型划分,8个专科赛道分别聚焦三类核心临床场景:

第一类为临床决策与全病程管理,涵盖呼吸专科(RESClinBench,联合广州实验室、广州医科大学附属第一医院钟南山院士团队打造),聚焦呼吸典型场景临床决策与全病程管理能力;心内科(MyoCardBench,联合复旦大学附属中山医院葛均波院士团队打造),聚焦心血管全诊疗场景一体化诊疗决策能力;儿科(PEDIASBench,联合上海市儿童医院打造),立足儿科门诊实景的综合处置与动态病情研判思维。

第二类为多模态诊断与综合评估,涵盖眼健康专科(OPHBench,联合上海交通大学医学院附属第九人民医院范先群院士团队打造),融合眼科多模态数据,评测眼病综合诊断与分级评估能力;中医专科(TCM-5CMEval,联合中国中医科学院、上海中医药大学打造),依托中医特色多模态信息,评测中医临床科研综合素养。

第三类为循证与问诊能力评估,涵盖随机对照试验循证证据质量评估(RCTBench,联合中山大学孙逸仙纪念医院打造)、基于改良评分系统的临床多轮问诊能力自动化测评(Mini-CEX)、医疗循证问答能力测评(MedEviBench,联合京东健康打造)等特色赛道。

上述评测全面覆盖急重症识别、慢病管理、多模态诊断、临床决策等复杂临床场景,评测设计深度贴合真实诊疗流程。此外,依托MedBench专科评测实践经验,对标国家《卫生健康行业人工智能应用场景参考指引》4大类行业标准,开展实施百余项医疗人工智能应用场景测评任务,覆盖医护人员专业辅助与患者服务,贯穿诊前诊后全环节真实临床需求。

共建开放生态,引领行业标准化发展

MedBench持续推动医疗AI评测行业的标准化、开源化、规模化发展,不断深化生态共建。

在开源数据与评测服务方面,MedBench已累计开源超7万条评测数据集,覆盖医疗伦理、医疗安全、医疗文本推理等核心领域,并服务近12万活跃行业用户,完成超31万次医疗大模型评测服务

在标准制定与赛事支撑方面,自上海医疗AI相关治理政策实施一年来,MedBench累计完成百余项医疗AI场景专项测评,常态化支撑行业服务登记前置审查工作,对备案大模型API调用类项目实施合规前置技术核验,并为6项国家级、省级人工智能赛事提供评测支撑。依托平台研究积淀,科研团队发布相关学术论文近30篇,申请专利、软著20余项,并深度参与10余项医疗AI评测标准制定。

在生态联盟构建方面,依托MedBench,上海AI实验室牵头成立的医学人工智能评测联盟,目前已汇聚国内500余家顶尖医疗机构、权威科研组织、头部科技企业与高等院校入驻,形成产学研用一体化的行业生态合力。

未来,上海AI实验室将持续迭代评测技术、完善评测体系、拓展专科赛道、深化生态共建,不断夯实医疗AI全生命周期安全评测能力,助力我国医疗人工智能高质量、安全化、规范化落地应用。

免责声明:

智慧医疗网转载其他网站内容,出于传递更多信息而非盈利之目的,内容仅供参考。版权归原作者所有,若有侵权,请联系我们删除。

本平台所发布信息的内容和准确性由提供消息的原单位或组织独立承担完全责任!

凡来源注明智慧医疗网的内容为智慧医疗网原创,转载需获授权。


Copyright © 2022 上海科雷会展服务有限公司 旗下「智慧医疗网」版权所有    ICP备案号:沪ICP备17004559号-5