通用大模型进儿科诊室“水土不服”,小儿方健康科技用15万条专家思维链重写规则

时氪分享·2026年08月24日 19:06
小儿方AI补基层儿科缺口,落地出海铺开增长版图

陕西渭南,一名12天没有排便的患儿被带到诊室,医生和家长交流的同时,旁边的"AI儿科医生"同步识别医患对话、生成病历。随着问诊信息不断补充,系统的诊断建议从"功能性便秘"动态变更为"需鉴别是否为先天性巨结肠"。

央视新闻《相对论》的镜头记录下了这一幕,接诊医生直言:“这个病我们也知道,但是不会首先考虑到。”

这句话捅破的,正是基层儿科诊疗最深的痛点:并非完全不知道某个病,而是在有限的信息里,缺乏像顶级专家那样迅速锁定方向、知道从哪问起、往哪深挖的判断力。

而补上这个判断力缺口的,是一个来自小儿方健康科技(下称"小儿方")的AI临床推理系统。这家成立于2018年的公司,联合国家儿童医学中心北京儿童医院,把“AI儿科医生”送到了全国30余家医疗机构的诊室。

2000例对标测试:通用模型仍有提升空间,小儿方越过临床分水岭

2026年初,OpenAI、Anthropic、微软在同一周发布了各自的医疗AI产品。大厂集体入场,AI医疗赛道的热度到了一个爆发前夜。

但把最强的通用模型放进儿科诊室,结果并不理想。

小儿方团队用2000例北京儿童医院真实病例做了一项测试:让当前最优的7个模型扮演医生,对AI模拟的标准病人进行问诊。结果显示,准确率最高的模型仅为68.1%,远低于人类专家水平。

更值得关注的是错误的构成:三分之二的错误出在“不会想”,模型缺乏专家级临床推理能力;三分之一出在“知识不够”,推理缺乏循证保障。

作为对照,小儿方AI儿科医生在同样的2000例病例、同样的评测条件下,诊断准确率达89%,五次独立一致率为80% (重复问诊5次结论一致的比例)。而上述通用模型在一致率这项上的最佳表现仅为55.1%。

问题出在哪?

大多数AI医疗产品做的事情是检索和问答:输入症状,输出疾病列表。这离真正的临床诊断还有距离,因为诊断的本质不是匹配,而是推理。医生面对一个主诉,脑子里会快速形成几条假设,通过追问、查体、检查来逐一验证或排除,最终锁定答案。单纯的检索,给不出这条推理链。

通用大模型擅长检索和生成,却不擅长像医生那样层层逼近地推理。而儿科又常常被称为“哑科”,患儿往往无法准确表达自身病情,对推理能力的要求反而更高。

15万条思维链:小儿方真正的护城河

让AI学会专家思维——这件事,光靠喂医学知识解决不了。

小儿方的技术路线,正是基于全球医学教育公认的临床推理框架——假设-演绎推理模型(Hypothetico-Deductive Reasoning)。

但框架需要“燃料”才能运转。小儿方找到的燃料,是别人拿不走的独有数据资产:

15万条思维链数据。医院病历记录的是“做了什么”和“结果是什么”,但很难凝练出医生“为什么这样想”“为什么先问这个”“为什么优先排除那个”。小儿方从2023年开始,联合北京儿童医院,把专家看病的完整推理路径逐条拆解、记录、审核,包括先问什么、再查什么、优先排除哪些可能。这些藏在专家脑子里的“隐性临床直觉”,已沉淀为15万条可用于训练的数据,也就是AI领域的思维链(CoT)。

循证知识库。 推理不能凭空发生,每一步假设的验证,都需要可靠的循证依据。小儿方整合了超300位北京儿童医院知名儿科专家的临床经验,结合约3000万份高质量病历、权威临床指南及最新科研成果,构建专业儿科知识体系,对AI的诊断结论进行循证验证,确保每一条建议都有据可依。

评测管线。医学诊断不是简单的是非题,如何科学评估模型的诊疗能力,本身就是一个重要课题。小儿方遵循真实诊疗的医学逻辑与临床特点,建立覆盖危险遗漏分级、分阶段预期诊断等精细标准的评测管线,通过大量专业标注与反复校验,精准衡量模型每一步医学推理的质量。

基于这三层核心资产,小儿方在自研大模型的底座上构建了 "推理生成,循证验证" 的双轮驱动架构:后训练让模型对齐专家推理思维,RAG保证诊断有据可依,Agent让AI能像医生一样主动追问、逐层逼近,推理优化则确保在诊室复杂环境下跑得稳、响应快、不添乱。

这套体系为什么别人复制不了?

创业公司够不到,是因为医学资源、产业关系、技术团队的获取门槛极高;大厂做不了,是因为严肃医疗需要长期深耕,与大厂的快速迭代逻辑并不兼容。

从实验室到落地:进了诊室才算数

模型再好,进不了诊室就是空中楼阁。

小儿方把复杂临床推理系统,做成了融入医生核心工作流的AI产品,并荣获2026年度德国红点奖产品设计奖,这也是中国AI医疗硬件首次获得该奖项。

但获奖从来不是目的。儿科诊室环境嘈杂、患儿哭闹、方言夹杂,产品团队花了大量精力强化语音抗噪能力,同时优化病历生成和实时推理速度,让系统能自然嵌入医生问诊流程,无需专门培训即可上手。

“医生主导、AI辅助” 这个定位看似简单,却是产品落地的关键。渭南市妇幼保健院儿科医生打了个比方:"辅助系统相当于一个拐杖,你起码得有腿才能用拐杖。"

拐杖好不好用,关键时候才知道。两个真实病例,比任何评测数据都直观:

第一例,AI纠偏。 渭南一名近2岁仍不会走路的孩子,曾被诊断为神经系统疾病,康复半年无效。AI儿科医生根据现有检查资料重新判断,建议做基因筛查,最终确诊为生长发育缓慢相关疾病,术后孩子已能行走。

第二例,AI拓界。 一名患儿出现呕吐和重度贫血,接诊医生起初考虑“营养性贫血”,AI儿科医生提示需警惕包括梅克尔憩室在内的先天性消化道异常,最终确诊。此后,当地医生将该类病例纳入每周复盘,对比AI分析拓宽诊治思路。“如果说当时没发现这个病,孩子的病情可能反反复复越来越重。”医生说。

截至2026年8月,AI儿科医生已在北京、陕西、山西、黑龙江、河南、江苏等全国12个省市的30余家医疗机构落地应用。从渭南市妇幼保健院起步,已拓展至富平、合阳、白水等县域妇幼保健机构,一个可在全国范围复制的推广模式已悄然成型。

去更远的地方:从基层诊所到"一带一路"

政策正在把门推开。

2025年11月,国家卫健委等五部门联合印发实施意见,明确提出到2030年基层诊疗智能辅助应用基本实现全覆盖,并聚焦儿科、精神、肿瘤及罕见病等重大疑难疾病的临床决策智能辅助应用。随后,北京市发布行动计划,优先支持儿科等领域AI技术发展。

门开了,但路需要有人先走通。小儿方是“儿童医学大模型与健康医疗创新医疗应用”北京市重点实验室共建单位。作为北京国家级人工智能医疗健康应用中试基地的参与单位,小儿方联合国家儿童医学中心北京儿童医院承担了AI儿科临床推理系统从研发到产业化落地的关键中试验证环节。

而门的另一边,不止是国内基层医疗机构。

“明年我们将去俄罗斯,带着我们的AI儿科医生去参展,像中亚五国、那五个斯坦,这些地方一样需要。”北京儿童医院院长倪鑫说。

小儿方健康科技携手北京儿童医院,已沉淀15 万条儿科专家思维链,从渭南县域妇幼起步,扎根国内下沉市场,同步开启 “一带一路” 出海布局,跑通了 AI 医疗从技术验证到规模化复制的完整闭环,以 AI 补齐全球儿科资源缺口。小儿方健康科技的增长版图,正在加速铺开。

+1
1

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

宇树股价的回落,不是机器人故事结束了。

1小时前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业