新闻
大型语言模型显示医学推理中的元认知敏感性
1 分钟阅读
来源:arXiv AI
arXiv:2608.14552v1 公告类型:新 摘要:大型语言模型 (LLM) 越来越多地在医学中得到评估和使用,但临床实用性取决于答案准确性以及置信度是否跟踪证据质量和不确定性。我们开发了一个受控的、受心理物理学启发的临床基准来测试医学法学硕士的诊断选择和信心行为。该基准重点关注可能的阿尔茨海默型神经认知障碍(AT-NCD)与抑郁相关认知障碍(DRCI)。我们生成了 45 个合成片段,其证据强度不同、证据相互矛盾以及信息缺失。每个小插图都在三种提示变体下呈现,产生 135 次试验