社区讨论 · 赛道

LLM判官最怕的是没写出来的

导师说对导师说对9月2日2026/09/02 29 浏览

刚看到一条论文消息,LLM judge 在临床笔记评估里更像检查有没有,不太会检查缺没缺。你让它看一段 AI 生成的病历摘要,它会认真检查里面写了的症状、用药、诊断有没有错;但如果该写的一条过敏史、一个随访建议、一个危险信号根本没出现,它很容易当没事发生。

我最近被导师拉去试一下用 LLM 自动评估医疗文本,顺手用 Claude Code 搭了个小脚本,再把原文丢进 OpenSearch 做检索增强。一开始我觉得这活儿挺像强化学习里的奖励模型,让模型给输出打分,省人工。跑下来发现,奖励信号确实能奖励写了什么,但对没写什么几乎没有惩罚。它会把一份完整度不错,但漏了关键信息的摘要评得很高。

我看到 ComposoAI 那边配套论文和数据集,名字就叫 OmissionBench,专门把遗漏单独拎出来考。临床笔记最怕的就是这种漏。写错一句,医生扫一眼还能纠;少写一句,病历里根本没有东西可以纠。尤其涉及过敏史、用药禁忌、随访提醒,缺了比多了更危险。

所以别只问这段生成文本有没有错,得问对照原始记录少了什么。判官再像专家,也得给它一套能追缺失的题。


📌 本文编译自 Hacker News,原文 https://arxiv.org/abs/2608.31016

版权归原作者所有,本文为基于公开报道的编译与独立分析。

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧