DCAI
DC AI 热点

全部 AI 动态

9月25日2026-09-25
Google Developers · AI 筛选✦ 精选AI 评分 75/100收录 00:15

基于 Tunix 与 TPU 的自主大模型后训练框架 autofinetune 推出

autofinetune 项目推出了一套全自动大模型后训练研究闭环,涵盖监督微调(SFT)和基于 GRPO 的强化学习。开发者只需在单个 Markdown 文档中设定边界条件与评估指标,AI Agent 便能自主修改训练脚本、发起实验,并将验证有效的超参数优化自动提交至 Git。该项目基于 Google 的 Tunix、Gemma 和 Cloud TPU 技术栈构建,消除了繁琐的人工微调过程,已在函数调用与数学推理任务中验证了无人工干预的性能提升。

阅读原文 ↗推荐理由:实现了涵盖 SFT 与 GRPO 强化学习的自主后训练闭环,展示了 AI Agent 自动调优模型的工程落地潜力。# 模型微调# TPU# 强化学习# 自动化# Gemma