DCAI
← 返回全部动态
arXiv 人工智能AI 评分 75/10009月25日 12:00

DEEPO:面向多模态大模型幻觉抑制的双熵增强策略优化

该研究探讨了强化学习在多模态大语言模型(MLLM)中抑制幻觉效果不稳定的问题,并归因于从奖励到参数更新纠错链中的两个弱点:在采样层面,高语义熵的困难查询易产生全错样本组,使最易产生幻觉区域的相对优势坍缩为零;在优化层面,高置信度的错误token存在梯度消失现象。为此,论文提出了双熵增强策略优化方法DEEPO,以改进参数更新机制并有效缓解多模态幻觉。

推荐理由深入剖析了强化学习训练多模态大模型时幻觉纠正链的失效机理,并提出了创新的双熵优化解决方案。

原标题:DEEPO: Dual-Entropy Enhanced Policy Optimization for Hallucination in MLLMs

阅读 arXiv 人工智能 原文 ↗