大模型在多语言亲属称谓上“能识别却难生成”:文化特定词汇生成基准研究
当前针对大语言模型在多语言亲属关系理解上的评估多采用多项选择,实质将其简化为识别任务。该研究构建了涵盖印地语、泰米尔语和韩语三种非西方语言的亲属称谓生成基准,测试了5款开源大模型在生成与选择任务中的表现。结果显示,模型普遍存在显著能力断层:GPT OSS 120B在对应选项识别中准确率达90.67%,但在自主生成中的合格率仅为36.00%,Llama 3.3 70B等模型亦呈现相同趋势。
当前针对大语言模型在多语言亲属关系理解上的评估多采用多项选择,实质将其简化为识别任务。该研究构建了涵盖印地语、泰米尔语和韩语三种非西方语言的亲属称谓生成基准,测试了5款开源大模型在生成与选择任务中的表现。结果显示,模型普遍存在显著能力断层:GPT OSS 120B在对应选项识别中准确率达90.67%,但在自主生成中的合格率仅为36.00%,Llama 3.3 70B等模型亦呈现相同趋势。
训练数据包含评测基准只能证明存在接触,却无法量化这种接触对评测表现的具体影响程度。为此,研究人员提出了干预性评估框架 LeakScale。该框架通过构建包含私有特定信息、且无法从公开任务中推导的新可执行任务,严格控制对这些信息的访问,从而利用反事实方法量化基准数据泄露对模型评测得分造成的实际因果影响。
针对现有评测基准多沿袭前沿大模型设计、导致紧凑型视觉语言模型难以拉开区分度的问题,研究人员推出了 PRISM-VLM 评测基准。该基准围绕轻量级多模态模型的常见失效模式,从任务质量、行为鲁棒性和能力瓶颈等七个关键维度对每个评测样本进行综合打分,并将其融合为单一的 PScore 指标,从而更精确、精细地评估紧凑型多模态模型的真实表现与局限性。
针对现代大语言模型因海量预训练数据导致基准泄露、评估可靠性受损的问题,以及基座模型因指令遵循能力受限而难以通过任务型标准评估的挑战,研究人员提出了 Uncheatable Eval。该动态基准通过定期采集最新发布的文本来评估基座语言模型,以规避数据污染风险,并利用模型预测能力与文本压缩能力之间的关联设计评估机制。原摘要在方法细节处截断。