PFArena:面向蛋白质修饰语言模型的全新评测基准
针对蛋白质修饰中序列空间庞大且湿实验验证成本高的问题,研究人员推出了名为 PFArena 的评测基准。尽管蛋白质语言模型(PLM)、大语言模型(LLM)及智能体在蛋白质修饰领域展现出潜力,但其在实际实验决策场景中的相对表现尚不明确。PFArena 包含四个受控任务接口,覆盖单突变体生成与多突变体排序,通过提供不同梯度的突变适应度数据,系统性评估各类模型在蛋白质设计与修饰任务中的决策能力。
针对蛋白质修饰中序列空间庞大且湿实验验证成本高的问题,研究人员推出了名为 PFArena 的评测基准。尽管蛋白质语言模型(PLM)、大语言模型(LLM)及智能体在蛋白质修饰领域展现出潜力,但其在实际实验决策场景中的相对表现尚不明确。PFArena 包含四个受控任务接口,覆盖单突变体生成与多突变体排序,通过提供不同梯度的突变适应度数据,系统性评估各类模型在蛋白质设计与修饰任务中的决策能力。
在去中心化的大语言模型多智能体系统中,单个智能体可能在保持响应的同时任务求解质量持续退化,引发灰度失效。针对此类问题,研究人员提出了完全去中心化的自愈框架MeshHeal。该框架在双时间尺度上结合能力匹配的同行评审机制:在快速时间尺度上,通过自适应分层机制升级不确定或低评分输出的评审层级;在提供即时任务保护的同时,收集证据以动态调整未来的路由决策,并允许恢复正常的智能体重新接入。
深度搜索要求大语言模型智能体分解复杂查询、检索证据并合成可靠答案。然而现有的 ReAct 架构智能体存在角色耦合(单策略兼顾规划、证据利用与合成)以及搜索历史累积导致上下文噪声增加的问题。为此,研究团队提出 IterSynth 范式,通过角色解耦与基于摘要的状态演进机制,在负责识别信息需求的规划器与负责整合证据的合成器之间交替执行,有效改善了深度搜索智能体的长程推理与信息合成能力。
现代大语言模型智能体大多依托于由模型与工具调用构成的核心循环(Agent Loop)运行,但处理记忆增强与自我改进等复杂工作流时,通常依赖复杂的额外工程系统。为此,研究团队构建了极简智能体框架JAZ,旨在探索仅依靠最基础的循环机制,在多大程度上能够替代并完成此类专门系统的任务。由于原文摘要结尾存在截断,关于JAZ具体暴露的接口与机制细节仍有待全文披露。