DCAI
DC AI 热点

全部 AI 动态

9月25日2026-09-25
arXiv 自然语言处理AI 评分 55/10012:00

基于措辞与选择的二维新闻标题框架审计研究(2022-2025)

该研究针对计算框架分析中常将操作简化为单一评分的问题,提出了一个分离措辞显著性框架与选择框架的二维分析体系。措辞显著性通过诱导性词汇、责任归咎、威胁框架及反问句四个维度衡量,选择框架则通过媒体层面的故事形态与高负荷分布衡量。研究利用三个大语言模型标注结合多数投票和人工仲裁,构建了包含10000条法语新闻标题的监督数据集并进行了系统验证。

阅读原文 ↗推荐理由:提出了一种解耦措辞与选择的媒体框架分析新范式,并利用大模型完成了规模化标注与审计验证。# 计算语言学# 大模型# 文本标注# 自然语言处理# 框架效应
arXiv 自然语言处理AI 评分 40/10012:00

用于提取西班牙语中英语借词的开源 Python 工具包 pylazaro

词汇借用是词典编纂和语料库语言学等数据密集型领域的重要研究课题,但现有标准文本处理工具库普遍缺乏该功能。本文推出了开源 Python 软件包 pylazaro,专注于从西班牙语文本中自动提取未同化的词汇借词(主要是英语借词)。该工具包整合了基于不同算法库训练的五个序列标注模型,并提供统一的调用接口,方便研究人员开展针对性的外来词检测与文本挖掘任务。

阅读原文 ↗推荐理由:针对西班牙语借词提取特定场景推出的开源 NLP 工具包,属于垂直领域的应用工程成果。# 自然语言处理# 开源# 序列标注# 计算语言学
arXiv 自然语言处理✦ 精选AI 评分 72/10012:00

稀疏自编码器隐空间中作为涌现类别的词性结构研究

该研究探讨了稀疏自编码器(SAE)在解析语言模型内部表征时揭示的语言学结构。作者以词性(PoS)类别为受控实验案例,分析形态句法信息究竟是由单个隐特征还是结构化特征组所编码。实验表明,词性差异高度可从SAE激活中恢复,但并非简单的一对一隐变量映射,且该恢复能力无法归结为单纯的词汇记忆,同时开放类与封闭类词性在表征特性上存在显著差异。

阅读原文 ↗推荐理由:聚焦大模型机制可解释性前沿,探讨了稀疏自编码器在解析语言形态句法表征时的有效性与结构特征。# 稀疏自编码器# 可解释性# 语言模型# 表征学习# 计算语言学