9月24日2026-09-24
AITNT · AI头条(网页)✦ 精选AI 评分 60/10013:57
近期后训练已成为大模型领域备受瞩目的核心议题。有企业推出低门槛的后训练服务,旨在通过两周一次的高频迭代节奏以及1000美元起的亲民价格,推动后训练技术向更广泛的开发者普及,实现“人人可用”。由于当前所获素材信息较为有限,关于该公司的具体技术路线、优化机制以及完整商业服务形态等细节,仍有待进一步披露。
arXiv 人工智能✦ 精选AI 评分 68/10012:00
针对结构化生物医学数据分析,表格基座模型展现出巨大潜力,其中TabPFN在小样本表格分类任务中表现尤为突出。然而,优化和预条件策略对生物医学场景微调的影响尚缺乏研究。本文对TabPFN v2.5展开系统性实证评估,在涵盖阿尔茨海默病、乳腺癌、精神分裂症等疾病及KEEL库的59个生物医学数据集上,测试了五种基于AdamW的预条件策略,为优化生物医学表格基座模型微调提供了实验参考。
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00
本文探讨了生产级智能客服系统中的核心部署问题:针对意图分类、问答、摘要和工具调用等多项技能,究竟应采用多个专用模型,还是通过多任务微调、连续更新或模型合并训练单一模型。研究团队基于 Qwen、Gemma、Llama 和 Mistral 等 5 个模型家族的 13 款模型(涵盖 0.6B 至 32B 参数),在 4 个公开及 4 个专有客服数据集上展开了系统性评测与策略比较。
arXiv 机器学习✦ 精选AI 评分 75/10012:00
该研究针对预训练流式生成模型的下游奖励微调问题,提出了一种名为Wasserstein倾斜流的新框架。传统方法多将其表述为基于KL散度正则化的奖励倾斜分布采样,而本研究构建了直接基于预训练漂移的最优传输正则化项。与传统的重加权基分布不同,该目标直接将单个样本输运至高奖励区域,使其等价于一种确定性过程,从而实现了免仿真的强化学习模型优化。
arXiv 人工智能✦ 精选AI 评分 72/10012:00
该论文针对自动定理证明(ATP)中微调大语言模型的对齐问题展开研究。当前大模型常作为树搜索的引导策略,而传统交叉熵损失在搜索场景下并非最优。将对齐策略拓展至树搜索具有较大挑战,因为证明发现过程高度依赖监督演示中未包含的偏离轨迹状态的探索与恢复。为此,作者拓展了相关计算对齐方法以直接优化搜索生成器。注:由于原摘要结尾截断,更多技术细节尚未完整披露。