Ai2 开源 AstaBrief 8B:报告生成提速约 3.5 倍
速览
- Ai2 开源 AstaBrief 8B,专用于科学报告生成并带引用
- 已作为 Asta 的 Fast mode 上线,与 Claude 驱动的 Thinking mode 并存
- Fast mode 平均 51.1 秒,Thinking mode 178.5 秒,约快 3.5 倍
- 训练走 SFT + DPO 路线,刻意避开不稳定且昂贵的强化学习
- SFT 用 90K 真实查询筛出 47K 样本,DPO 约 6K 条
- 双评审一致才保留偏好对,评审与人类偏好一致率 95%
- 模型改为一次性生成全文,跳过片段摘要与聚类阶段
- 开源权重便于机构在自有基础设施上处理敏感或未发表研究
Ai2 开源了面向科学报告生成的模型 AstaBrief 8B,该模型以 Qwen3-8B 为基座,输入研究问题与检索到的文献片段,直接一次性生成带引用的报告。AstaBrief 已作为 Asta「Generate a report」功能中的 Fast mode 上线,与 Claude 驱动的 Thinking mode 并列。Ai2 称,在完整 Asta 流程中,Fast mode 平均每份报告耗时 51.1 秒,Thinking mode 为 178.5 秒,约快 3.5 倍,相比其跟踪的专有模型接近一个数量级的生成时间缩减。训练上,Ai2 未采用强化学习路线,而是选择监督微调(SFT)加直接偏好优化(DPO)的较简单方案,重点投入数据质量。SFT 数据来自约 90K 条真实科研查询,经 ScholarQA 多步流程生成报告后筛选出 47K 条可用训练样本;DPO 数据约 6K 条,由两个评审模型 GPT-4.1 与 DeepSeek-R1 一致同意才保留,评审与人类偏好一致率为 95%。Ai2 同时开源模型权重、训练数据以及一个可让研究者用自己 PDF 生成报告的示例工作流,便于机构在自有基础设施上运行。
关键事实
- AstaBrief 8B 基于 Qwen3-8B,输入研究问题与检索文献片段,一次性生成带引用的报告
- 完整 Asta 流程中 Fast mode 平均 51.1 秒/报告,Thinking mode 为 178.5 秒,约快 3.5 倍
- SFT 数据来自约 90K 条科研查询,筛选后得到 47K 条可用训练样本
- DPO 数据集约 6K 条,由 GPT-4.1 与 DeepSeek-R1 双评审一致同意后保留,评审与人类偏好一致率 95%
- 训练与评测大部分在 2025 年完成,未针对当前前沿模型重跑完整评测
- Ai2 开源模型权重、训练数据,并发布一个用自有 PDF 生成报告的示例工作流
为什么值得关注
对科研用户而言,Fast mode 让初步报告在约 51 秒内产出,便于后续多轮迭代;开源权重与训练数据则让机构能在自有基础设施上运行,处理敏感或未发表研究,并复现与改进该方法。
背景与影响
科学写作对模型有特殊要求:结论必须锚定证据、不能悄悄放大研究结论,且研究者需要能核验输出。Ai2 通过 Asta 平台观察到,科研用户常带着大量上下文与多重约束提问,并把生成的报告当作可反复使用的研究材料。此前其 DR Tulu 等工作显示强化学习可提升开源模型的长文报告生成,但 Ai2 这次选择更易调试、成本更低的 SFT + DPO 方案。
本文整理自公开报道,版权归原作者所有;文中观点仅供参考,不代表本站立场。如有版权问题,请联系我们。