人工智能走进医院和汽车之后,最先需要的不是掌声,而是一把能反复使用的尺子。没有尺子,所谓“聪明”只能靠演示;有了标准,系统才要在相同条件下接受检查。
8月,国家市场监督管理部门批准发布338项国家标准,其中15项为强制性标准、323项为推荐性标准。新标准涉及人工智能医疗器械质量要求和评价术语,也包括智能网联汽车自动驾驶系统安全要求。另一边,美国国家标准与技术研究机构持续更新人工智能风险管理框架,强调在设计、开发、使用和评价全过程管理可信风险。
两个体系的法律形式和适用场景不同,却指向同一个行业常识:人工智能一旦进入高风险场景,不能只问“能不能用”,必须问“怎样证明它在边界内可靠”。
标准先统一语言,才能统一检查
人工智能医疗器械涉及数据、算法、软件、传感器和临床使用。开发人员说“准确”,医生可能关心漏诊,监管者还要看不同人群和不同设备条件下是否稳定。若大家对质量、性能、风险的术语理解不一,测试报告就像几块不同刻度的仪表盘,数字都有,彼此无法比较。
评价术语标准的价值,首先是让行业说同一种技术语言。什么是训练数据,什么是验证数据,性能如何测量,软件更新后是否需要重新评价,这些看似枯燥的定义,决定了产品能否被审查和追责。
创新靠想象打开门,标准负责确认门后不是悬崖。
医疗人工智能最怕“平均准确”
一个模型在总体样本上表现良好,不代表它对每个年龄、地区、设备和疾病阶段都同样可靠。训练数据若主要来自某类人群,换到另一家医院可能出现偏差;影像设备参数不同,也可能改变输入质量。
因此,医疗器械评价不能只报一个漂亮的平均准确率。要看灵敏度、特异度、漏诊和误报,还要说明适用人群、禁用场景和人工复核要求。算法给出的结果若会影响治疗,医生必须知道它的边界,而不是面对一个无法解释的分数。
软件更新同样关键。传统器械出厂后结构相对稳定,人工智能系统可能持续升级。一次测试通过,并不意味着后续版本自动合格。版本记录、变更范围、回滚能力和再验证机制,都应成为质量体系的一部分。
自动驾驶的安全,不是“开过多少公里”一句话
自动驾驶系统面对的是开放道路。晴天、暴雨、逆光、施工、行人突然横穿,每个场景都可能改变结果。里程很重要,但如果测试大多发生在简单道路,千万公里也未必覆盖罕见危险。
强制性安全要求的意义,是把设计、开发和测试的最低边界写清楚。系统要识别哪些目标,发生故障时怎样降级,人类驾驶员何时接管,数据如何记录,事故后能否还原。这些问题没有统一要求,企业就可能各自挑最有利的指标展示。
真正可靠的测试应同时看常规表现和极端场景。日常行驶要平稳,遇到异常也要可控。安全不是“从未出错”的宣传,而是出错概率被测量、后果被限制、责任能追踪。
推荐性标准并不等于可有可无
338项标准中,推荐性标准有323项。有人会觉得“推荐”就不重要,其实很多产业协同正靠推荐标准完成。接口、术语、测试方法和数据格式若能一致,供应商之间更容易兼容,采购方也更容易比较。
强制性标准负责守住安全底线,推荐性标准则帮助行业减少重复试错。两者像机器上的保险装置与通用接口,一个防止事故,一个提高效率。若所有细节都强制,创新可能受限;若全部自愿,安全底线又可能被竞争压力冲淡。
标准不能冻结技术,要能跟着风险更新
人工智能变化快,标准制定最难的是既不能落后太多,也不能把某种短期技术路线写成永久答案。更稳妥的做法,是围绕风险和结果设要求:数据要可追溯,性能要可验证,系统要能监测,重大变更要重新评价。
美国人工智能风险管理框架采用自愿方式,强调治理、识别、测量和管理风险。中国此次发布的医疗人工智能术语与质量标准、自动驾驶安全要求,则对应具体产业和安全场景。不同制度可以互相参考测试思想,但不能简单照搬。道路、医疗体系、法律责任和数据环境不同,标准必须落在本地真实使用条件上。
企业真正要准备的是证据链
对企业来说,标准发布后最现实的工作不是在宣传材料里加一句“符合要求”,而是建立完整证据链。从数据来源、标注规则、训练过程、测试样本,到版本变更、故障记录和用户反馈,每一步都要能回溯。
这会增加短期成本,却能减少长期返工。缺少记录时,产品出现问题只能靠人回忆;有了证据链,企业可以定位是数据、模型、传感器还是使用流程出了问题。质量管理不是给研发套绳子,而是给复杂系统装黑匣子。
供应链企业也会被纳入。一个医疗人工智能产品可能使用第三方模型、设备和云服务;自动驾驶系统还依赖摄像头、雷达、地图和控制器。整机厂不能把责任推给某个零件,供应商也不能只保证实验室参数。接口和责任边界必须事先写清。
标准是进入规模化的门票
小规模试点时,专家可以盯着每次运行;进入千家医院、万辆汽车后,系统必须靠标准化流程保持一致。规模越大,偶发错误的绝对数量越可能增加,质量控制也越不能依赖少数能人。
中国在人工智能应用、医疗器械制造和智能汽车产业上拥有丰富场景,这为标准验证提供了真实条件。用好这些场景,不是降低门槛让产品快上,而是通过足够多样的测试把风险找出来。敢把问题暴露在标准测试里,才是真正的产业自信。
标准不会替代创新,也不会保证零事故。它的价值,是让创新从“我觉得可以”变成“我有证据说明在这些条件下可以”。这一步看着慢,却是高风险技术走向大规模应用最快的路。
人工智能进入医院和道路之后,最有价值的能力不是像人一样自信,而是在不确定时知道停下,并留下足够证据解释为什么。