在医疗报告质控场景中,我们反复面临一个取舍:规则系统准确但不灵活,大模型灵活却不稳定。最终的选择不是二选一,而是让两者各司其职。
规则引擎:解决确定性问题
有一类质控问题是结构化的、非此即彼的,规则能以近乎零成本的方式精准命中:
- 患者标识、性别、年龄、检查项目等必填字段是否缺失
- 报告描述中出现的器官与患者性别是否矛盾
- 采用标准化分级的检查是否给出明确分级,分级与描述是否冲突
- 是否出现常见错别字或不规范表述
这类问题的共同特点是判定标准清晰、结果可解释、响应在秒级。用大模型去做反而大材小用,还引入了不必要的随机性。
AI 语义引擎:覆盖规则难以穷举的盲区
但报告中还有另一类问题,恰恰是规则的天花板所在:报告前半部分描述"未见异常",结论却给出明确病灶诊断;前后两段对同一部位的描述相互矛盾;表述虽无错字但逻辑不通。
这类语义层面的矛盾难以用关键词或句式穷举,而这正是大模型的强项。
裁判员机制:给 AI 输出加上一道闸门
医疗场景对准确性的要求远高于通用场景。模型的"幻觉"一旦被医生采信,不仅无助于质控,反而会干扰判断。因此我们没有把 AI 输出直接呈现给医生,而是设置了多重把关:
- 裁判员复核:AI 给出的问题由独立的校验环节二次确认,过滤缺乏依据的判断
- 置信度阈值:低于阈值的判断不予采纳,阈值可按科室需要调整
- 误报豁免:内置豁免词表,排除容易误判的表述模式
- 白名单机制:经科室确认无需检查的场景可加入白名单
- 温度参数锁定为 0:确保同一份报告多次质控结论一致,结果可复现
设计原则——宁可漏报,不可误报。在医疗场景中,错误的提示会消耗医生的信任,其代价高于偶尔的漏检。
让系统越用越准
系统允许医生对认定为误报的问题点击"忽略"并填写原因,也可点击"漏报"补充上报系统未发现的问题。这两类反馈都会回写服务端,成为规则优化与模型调优的依据。
这正是区别于"一次性交付"工具的关键:质控系统因此具备了持续进化的能力,科室的每一次反馈都在校正系统对本院实际业务的理解。