产品介绍
Data-to-Paper 是什么?
Data-to-Paper 是开源自动化框架,引导语言模型智能体和规则智能体完成端到端科学研究。从原始数据开始,它可探索数据集、检索文献、提出并检验假设、编写和调试分析代码、解释结果,最终生成完整论文。
该框架强调透明和向后追溯。生成论文中的数值可追踪至产生它们的代码。系统既可自主运行,也可通过 Copilot 应用由研究者设置目标、检查和指导工作、审查输出、回退步骤、记录与重放运行,并监控 API 成本。
如何使用 Data-to-Paper
- 安装 Python 软件包及文档列出的依赖。
- 运行
data-to-paper命令并提供受支持的数据集或研究案例。 - 选择自主模式,或通过 Copilot 设置目标、检查进度、审查工作和回退步骤。
- 审查生成的分析,并将论文数值追溯至对应源代码。
- 在使用前由领域专家验证论文的严谨性、准确性、伦理和结论。
核心功能
- 端到端研究自动化: 覆盖探索、文献检索、假设生成、分析、解释和论文写作。
- 可向后追溯论文: 将数值陈述连接到生成它们的分析代码。
- Autopilot 与 Copilot: 支持自主运行或人工引导研究。
- 审查与回退: 可检查、指导、评审、重放并返回早期步骤。
- 编程防护: 为统计软件包加入防护,减少模型生成代码的常见错误。
- API 成本跟踪: 帮助监控模型用量和相关费用。
使用场景
- 探索性数据研究: 从陌生数据集形成候选问题和分析。
- 假设检验: 针对较简单的研究目标提出并检验统计假设。
- 可复现论文生成: 生成结果可追溯到代码的论文。
- AI 研究评估: 研究自主科学智能体的能力和局限。
定价
Data-to-Paper 采用 MIT 许可证分发,仓库不收取软件订阅费,但用户需承担外部语言模型 API 成本。
常见问题
仍然需要人工审查吗?
需要。维护者明确说明流程并非零错误,必须由领域专家监督。
可以在没有持续指导时运行吗?
可以。它支持自主模式和人工引导的 Copilot 模式。
适合什么研究?
仓库说明目前主要面向涉及统计假设的较简单研究目标和数据集。


