新闻

标记错误症状:评估医学文本中的法学硕士水印

1 分钟阅读
来源:arXiv AI
arXiv:2607.20462v1 公告类型:新 摘要:大型语言模型 (LLM) 越来越多地集成到临床工作流程中,强调需要对带有水印的模型生成的输出进行可靠的可追溯性。然而,大多数水印都是在通用基准上进行评估的,而医学等领域的小标记级扰动可能会导致重大的语义变化,而这些领域尚未得到充分探索。在这项工作中,我们首次对 LLM 水印如何影响医疗绩效进行了严格的研究,对 11 个 LLM 和 7 个 VLM 的 5 个水印方案进行了跨单模态和多模态临床推理的各种任务的基准测试。重要的是,我们通过 int 来补充现有的评估