ESC
AI 2 分钟阅读

PRAXIST:面向可衡量、可计算执行研究的自主研究系统

Praxist 是一个自主研究系统,面向可衡量且可在计算机上执行的研究。它协调并行研究体、任务专属评估、持久证据与代际综合,将研究视为持续过程,而非离散提示序列。支持多代进化、质量-多样性探索、深度创新门控等,并可与 Codex、Claude Code 集成。采用 Fair Source 许可,年收入低于100万美元的组织可免费商用。

来源:GitHub

Praxist

Praxist:认识你的专属研发团队

CI 文档 arXiv 论文 Discord Python 3.11+

Praxist 是一个用于可衡量、可在计算机上执行的研究的自主研究系统。它协调并行研究体、任务专属评估、持久证据以及代际之间的综合。

Praxist 将研究视为一个持续过程,而非一系列孤立的提示。当项目已经运行且目标可衡量,但最佳前向路径仍未知时,请使用它。

Praxist 架构

安装 Praxist

通过一条命令安装完整的运行时集成并完成首次使用配置:

python3 -m pip install --index-url https://pypi.org/simple "praxist[agents,codex]" && praxist setup --interactive --install-skills codex

本地向导涵盖公平源代码许可、用户协议、隐私、运行时配置、掩码凭据、Codex 技能、可写示例和就绪检查。它不会选择研究项目或启动运行。对于 Claude Code,请使用特定主机的一行命令。

如需代理管理的安装,请打开 Codex:

codex --yolo

然后要求它使用打包的 OOBE 运行手册安装并配置 Praxist,并在就绪检查后停止。

开始研究之前,请阅读快速入门和你的第一个任务。它们描述了独立的接管步骤及其创建的项目契约。

选择 Codex 原生模式 可不使用 API 密钥而利用现有 Codex 订阅。对于持续性研究,Praxist 通常更倾向于具有高观察缓存命中率的开源模型 API。设置向导还支持其他基于 API 的配置。

通过 Codex 使用 Praxist

我们推荐使用 Codex 作为操作 Praxist 的界面。Praxist 不是 Codex 的替代品:Codex 仍然是理解你的项目、与你沟通并使用开发工具的交互式代理。Praxist 增加了持久研究循环、并行体、证据协议、调度和生命周期控制。

安装后,在已可运行的研究项目根目录中打开 Codex,并调用 $praxist-takeover。接管技能会检查就绪状态,创建或修复任务框架,验证其评估器和证据契约,并在必需的门禁通过后启动运行。精确的简报会产生更好的研究计划;请包括目标、指标、约束、资源、探索选择以及是否授权启动。

示例接管简报
$praxist-takeover

将当前目录视为现有的可运行研究项目。在任何更改之前,验证基线和其评估路径。

优化 <主要指标和方向>,同时保持 <关键约束>。在 <时间或成本预算> 内使用 <同行数量> 个同行进行最多 <代数数量> 代。使用安装期间选择的运行时和模型提供商。<允许或禁止> 文献搜索,<启用或禁用> QD,以及 <启用或禁用> 第零代 DIG。

不要下载新数据集或替换必需的项目资产。构建一个具有明确指标方向、基线来源、协议完整性检查、证据成熟度规则和合理保留通道的独立任务框架。就绪检查通过后,<立即以分离模式启动 / 请求确认>。报告任务路径、运行 ID、证据契约、代次关闭策略和监控命令。

其他内置技能:

技能用途
praxist-takeover-codex使用已保存的 Codex 登录进行无密钥接管
praxist-onboarding解释 Praxist 并检查本地就绪状态
praxist-task-initialization构建或修复任务框架而不启动
praxist-interactive-task-init通过先确认的方式设计任务
praxist-control启动、停止、恢复、监控和检查运行
praxist-diagnostic诊断运行健康并生成报告
praxist-scientific-research收集有来源的文献和基准上下文
praxist-runtime-install安装或修复运行时依赖和凭据
terminal-line-plot在终端中绘制指标趋势

请参阅代理技能了解调用语法,以及生成的技能参考了解完整契约。

Praxist 提供什么

能力用途
并行研究体并发探索竞争性假设和实现
多代综合将有用的证据和策略延续到后续代次
持久证据通道在孵化器、前沿和 Gems 状态中保留候选方案
多指标评估对任务定义的证据进行排序,包括帕累托最优权衡
质量-多样性 (QD) 和可选的深度创新门 (DIG)在不强制单一探索策略的情况下保持多样性
集中资源调度根据观察到的资源压力调整实验准入
恢复、重放和监控保持长时间运行的研究可检查和可恢复
插件边界支持多种运行时、提供商、工具、预算和工作流

Praxist 与任务项目

Praxist 拥有任务项目拥有
研究编排、生命周期、证据协议、重放、调度和扩展接口研究目标、可执行代码、评估器、指标、基线、提示、角色和领域约束

Praxist 不包含任务特定的科学假设。任务仍然是关于应测试什么以及什么构成有效证据的唯一事实来源。

操作一次运行

praxist status --json
praxist --monitor --latest
praxist stop <run_id>
praxist resume <run_dir>

Ctrl-C 仅关闭监控器;它不会停止研究运行。

示例和模板

praxist examples list
praxist examples install rocket_booster_recovery
praxist examples install rocket_booster_recovery_rust

完整示例是可写的参考项目。templates/tasks/ 包含用于构建新任务框架的可替换脚手架。两个 Rocket Booster Recovery 示例分别通过 Python/JAX 和原生 Rust 实现演示了相同的研究问题。

要求

状态要求
必需CPython 3.11+
启动研究必需具有可衡量评估的可运行项目
技能驱动操作必需Codex 或 Claude Code;直接 CLI 操作仍可无需二者使用
认证:选择其一已保存的 Codex 登录(Codex 原生模式),或受支持的提供商 API 密钥
持续发布测试Linux 上的 CPython 3.11 和 3.12
兼容性目标macOS 及其他 CPython 3.11+ 环境;研究前运行 praxist doctor

任务特定的数据集和计算依赖仍由任务项目拥有。

请参阅平台支持矩阵了解发布合格主机与兼容性目标之间的区别。

文档

阅读 Praxist 文档 或通过以下方式打开:

praxist docs

无需本地文档服务器。

为 Praxist 做贡献

在参与之前,请阅读贡献指南以及行为准则。源代码维护者还应遵循 AGENTS.md 中的架构和维护契约。有关 Praxist 的数据处理条款,请参阅隐私声明。

联系方式:praxist@sapient.inc

常见问题

显示问题和答案

问1:Praxist 是什么?

Praxist 是一个用于可在计算机上执行的可衡量研究问题的自主研究系统。它将一个已经可运行的项目转变为持续、证据驱动的研究运行。

在连续代次中,并行研究代理开发候选解决方案;评估器将结果转换为结构化证据;规划面板将这些证据综合为下一代的研究议程。循环持续直到搜索收敛或预算耗尽。

你提供一个可运行的项目和一个可衡量的目标。Praxist 编排研究过程,以搜索性能最佳的解决方案。

问2:Praxist 与手动调优或 AutoML 有何不同?

AutoML 在预定义搜索空间内调整参数。Praxist 运行完整的研究循环。

并行研究代理可以更改方法、架构和策略。评估证据塑造下一代的议程,而深度创新门 (DIG) 和质量-多样性 (QD) 分配帮助系统逃离局部最优。

Praxist 更接近于自我指导的研究团队,而非搜索工具。如果你的研究人员已经在手动迭代问题,Praxist 将接管迭代循环本身。

问3:我的项目适合 Praxist 吗?

当满足三个条件时,Praxist 能带来最大价值:

  • 目标可衡量: 至少有一个指标能有意义地区分优劣,并具有明确的优化方向。
  • 项目已经可运行: 基线代码、环境和所需数据或模拟器已就位,且无需 Praxist 即可运行。
  • 最佳前向路径未知。

如果缺少某项前提,Praxist 会停止并明确告知你需要什么。它不会静默下载未指定的数据集、发明模拟器或虚构基线性能。这是一个刻意的设计原则。

问4:我需要 API 密钥吗?成本是多少?

在 Codex 原生模式下不需要 API 密钥;Praxist 使用你已认证的 Codex 会话。我们也建议使用你自己的 API 密钥访问支持的模型 API。

API 成本由提供商设定,因模型和使用量而异。总成本还取决于并行度、代次数量和评估运行时间。对于成本敏感的运行,先从小型代表性工作负载开始,再扩展。

问5:Praxist 如何保护我的代码和数据?

Praxist 提供三层保护:

  • 项目隔离: Praxist 不会修改你的原始项目。运行工件单独存储。
  • 凭据: API 密钥通过掩码本地提示输入,不会在命令、Shell 历史或对话中暴露。
  • 数据收集: Praxist 不收集实验中使用的数据。它仅收集有限的系统级操作信息,你可以随时禁用。

问6:如何信任报告的改进是真实的?

Praxist 使用三项保障措施:

  • 预注册: 指标、评估协议、基线和验收阈值在运行前定义。
  • 一致评估: 每个候选方案都通过同一评估器测量,无效或可疑结果被排除。
  • 端到端溯源: 每个报告的改进都包含检查和复现所需的证据和谱系。

我们建议审查所选解决方案更改的内容,并在你自己的环境中再次测试。Praxist 的结果设计为可验证的,你自己的验证应是最终测试。

问7:如果 Praxist 没有改进结果会怎样?

Praxist 不保证特定的指标改进。它提供严谨的研究过程和可审计的证据。

如果运行未达到目标,你仍会收到阴性结果证据包、审计报告以及关于停止或重定向研究的建议。

阴性结果仍有价值:它用证据排除了已测试的方法,并有助于防止在无效方向上进一步投入。

问8:Praxist 是开源的吗?其输出适用什么条款?

Praxist 根据公平源代码许可协议 1.0 获得许可。准确的描述是源代码可用:完整源代码公开可用,可以查看、下载和修改。根据许可条款,Praxist 可用于内部业务目的,并部署在你自己的组织内。

年总收入(包括关联公司收入)低于 100 万美元的组织可免费商业使用 Praxist。一旦年收入达到或超过该阈值,组织必须联系许可方 Sapient Intelligence Pte Ltd 协商商业许可。

收入阈值不适用于高等教育机构、公共研究机构和非营利学术研究组织进行的合格教学和学术研究。

生成的输出: 内部使用不需要署名。如果输出对外发布或以其他方式提供给第三方,则必须保留产品名称署名“Praxist by Sapient Intelligence”。

本常见问题仅为摘要。若与公平源代码许可协议 1.0 冲突,以许可协议条款为准。

引用

如果你在研究中使用 Praxist,请引用:

@misc{li2026praxistexperimentalartifactssolution,
      title={Praxist: From Experimental Artifacts to Solution Lineages},
      author={Jin Li and Ahmed Murtadha and Zhiyu Wang and Qiwen Chen and William Chen and Yifei Wu and Guan Wang and Andy L. Siy and Jiayi Yang and Mengsha Huang and Wenhao Li and Yixuan Liu and Shuailin Pan and Mingli Yuan and Sen Song and Yuhao Sun},
      year={2026},
      eprint={2608.25955},
      archivePrefix={arXiv},
      primaryClass={cs.MA},
      url={https://arxiv.org/abs/2608.25955},
}