Skip to content

ARI 设计哲学

ARI 为何存在

研究自动化在历史上一直需要以下条件之一:

  • 昂贵的云基础设施
  • 内部工程专业知识
  • 无法迁移的领域专用工具

ARI 建立在这样一个信念之上:从"有一个想法"到"获得一个结果"之间的差距应该以小时而非月份来衡量 — 无论您拥有什么资源。

通用性的五个维度

1. 计算:笔记本电脑 → 超级计算机

ARI 在笔记本电脑(mode: local)和 SLURM 集群上的运行方式完全一致。相同的实验文件、相同的配置格式、相同的输出结构。切换只需修改 workflow.yaml 中的一行。

yaml
hpc:
  mode: local      # laptop
  mode: slurm      # HPC cluster
  partition: your_partition

2. LLM:本地 → 商业

ARI 通过 litellm 代理所有 LLM 调用。模型是配置项 — 不是代码。

yaml
llm:
  model: qwen3:8b           # Ollama, no API key, runs offline
  model: gpt-5.2            # OpenAI API
  model: claude-sonnet-4-5    # Anthropic API
  base_url: http://...      # Any OpenAI-compatible API

3. 专业水平:新手 → 专家

实验 .md 格式除了研究目标之外没有任何必填字段。新手只需写 3 行,专家可以写 200 行。ARI 都能读取。

4. 领域:计算 → 物理世界

ARI 的核心没有"实验类型"的概念。它只知道:

  • 有一个目标
  • 有工具(MCP 技能)
  • 有质量信号(LLM 分配的 scientific_score)
  • 智能体应搜索能最大化科学贡献的配置

这种抽象同样适用于参数优化、ML 超参数调优、机器人手臂轨迹或湿实验室协议。

5. 输出:结果 → 经过验证的论文

ARI 不会在"找到最佳结果"后停止。它会:

  1. 遍历完整的实验树(包括消融实验和验证运行)
  2. 使用 LLM 从原始产物中提取科学上下文
  3. 生成包含图表和引用的出版级 LaTeX
  4. 将论文提交给 LLM 审稿人获取质量反馈
  5. 运行可复现性智能体重新执行实验并验证声称的数值

零领域知识原则

ARI 的生产代码不包含任何领域知识。

这不仅仅是设计偏好 — 这是在代码审查中强制执行的硬性不变量。

在实践中这意味着:

禁止正确做法
if "score" in metric_name使用 LLM 的 scientific_score
grep -i "compiler|flags"LLM 自由读取产物
在提示中写 "compare against baseline"LLM 决定与什么比较
硬编码图表类型LLM 决定绘制什么图表
+0.2 评分权重LLM 进行整体评分
系统提示中包含 lscpuLLM 如果运行了 lscpu 就读取其输出

ARI 核心唯一规定的内容:

  • 格式:工具调用使用 JSON,实验使用 Markdown
  • 协议:技能通信使用 MCP
  • 信号scientific_score(LLM 分配 0.0-1.0)驱动 BFTS

其他所有事项 — 测量什么、如何比较、哪些硬件细节重要、绘制什么图表、包含什么引用 — 都由 LLM 在运行时自主决定。

为什么选择 scientific_score?

以前的版本使用领域专用关键词(scorebandwidth)来对节点排名。这在特定领域有效,但在其他领域会静默失败。

scientific_score 是由 LLM 评估器作为同行评审者分配的 0.0-1.0 质量信号。它从整体上捕捉科学严谨性:

  • 实验是否产生了真实的测量数据?
  • 结果是否与现有方法进行了比较?
  • 方法论是否可复现?
  • 结果是否支持一个清晰的科学论断?

LLM 决定权重。ARI 只读取数值。

为什么选择 MCP?

Model Context Protocol 赋予 ARI 三个特性:

  1. 隔离性:每个技能是一个独立进程。论文生成中的错误不会破坏 HPC 作业。
  2. 可替换性:替换任何技能无需触及其他技能。
  3. 可发现性:LLM 智能体在运行时发现可用工具。添加技能 = 新功能,无需重新编程智能体。

通向物理世界的路径

当前的技能集覆盖数字计算。MCP 架构的设计是为了扩展:

Sensor reading     → ari-skill-sensor
Actuator control   → ari-skill-robot
Lab automation     → ari-skill-labware
Real-time feedback → ari-skill-control

BFTS 智能体将使用与当今优化实验参数相同的基础设施来优化物理参数 — 反应温度、机器人速度、混合比例。

非目标

ARI 明确不以以下为设计目标:

  • 替代领域专业知识(它是放大器)
  • 在物理风险边界上无人监督运行
  • 成为黑盒(每个决策都被记录并可追溯)
  • 对任何特定领域的"好科学"有硬编码的看法

推论:失败的实验也是信息

当一个节点失败时,ARI 不会重试相同的方法。相反,失败的节点进入 frontier,expand() 生成继承了失败上下文的 debug 子节点。下一代从失败中学习 — 这与重试逻辑有本质区别,后者将失败视为噪声而非信号。

推论:可复现性是第一性原则

ARI 的智能体系统提示包含一条通用科学原则:确保你的实验是可复现的。这不是领域规则 — 它同样适用于化学、HPC 和机器学习。智能体自主决定需要捕获什么信息。论文审稿人随后独立评估论文是否可复现,从而形成闭环,不依赖任何硬编码的标准。

另请参阅

架构 · BFTS 算法