ARI 设计哲学
ARI 为何存在
研究自动化在历史上一直需要以下条件之一:
- 昂贵的云基础设施
- 内部工程专业知识
- 无法迁移的领域专用工具
ARI 建立在这样一个信念之上:从"有一个想法"到"获得一个结果"之间的差距应该以小时而非月份来衡量 — 无论您拥有什么资源。
通用性的五个维度
1. 计算:笔记本电脑 → 超级计算机
ARI 在笔记本电脑(mode: local)和 SLURM 集群上的运行方式完全一致。相同的实验文件、相同的配置格式、相同的输出结构。切换只需修改 workflow.yaml 中的一行。
hpc:
mode: local # laptop
mode: slurm # HPC cluster
partition: your_partition2. LLM:本地 → 商业
ARI 通过 litellm 代理所有 LLM 调用。模型是配置项 — 不是代码。
llm:
model: qwen3:8b # Ollama, no API key, runs offline
model: gpt-5.2 # OpenAI API
model: claude-sonnet-4-5 # Anthropic API
base_url: http://... # Any OpenAI-compatible API3. 专业水平:新手 → 专家
实验 .md 格式除了研究目标之外没有任何必填字段。新手只需写 3 行,专家可以写 200 行。ARI 都能读取。
4. 领域:计算 → 物理世界
ARI 的核心没有"实验类型"的概念。它只知道:
- 有一个目标
- 有工具(MCP 技能)
- 有质量信号(LLM 分配的 scientific_score)
- 智能体应搜索能最大化科学贡献的配置
这种抽象同样适用于参数优化、ML 超参数调优、机器人手臂轨迹或湿实验室协议。
5. 输出:结果 → 经过验证的论文
ARI 不会在"找到最佳结果"后停止。它会:
- 遍历完整的实验树(包括消融实验和验证运行)
- 使用 LLM 从原始产物中提取科学上下文
- 生成包含图表和引用的出版级 LaTeX
- 将论文提交给 LLM 审稿人获取质量反馈
- 运行可复现性智能体重新执行实验并验证声称的数值
零领域知识原则
ARI 的生产代码不包含任何领域知识。
这不仅仅是设计偏好 — 这是在代码审查中强制执行的硬性不变量。
在实践中这意味着:
| 禁止 | 正确做法 |
|---|---|
if "score" in metric_name | 使用 LLM 的 scientific_score |
grep -i "compiler|flags" | LLM 自由读取产物 |
在提示中写 "compare against baseline" | LLM 决定与什么比较 |
| 硬编码图表类型 | LLM 决定绘制什么图表 |
+0.2 评分权重 | LLM 进行整体评分 |
系统提示中包含 lscpu | LLM 如果运行了 lscpu 就读取其输出 |
ARI 核心唯一规定的内容:
- 格式:工具调用使用 JSON,实验使用 Markdown
- 协议:技能通信使用 MCP
- 信号:
scientific_score(LLM 分配 0.0-1.0)驱动 BFTS
其他所有事项 — 测量什么、如何比较、哪些硬件细节重要、绘制什么图表、包含什么引用 — 都由 LLM 在运行时自主决定。
为什么选择 scientific_score?
以前的版本使用领域专用关键词(score、bandwidth)来对节点排名。这在特定领域有效,但在其他领域会静默失败。
scientific_score 是由 LLM 评估器作为同行评审者分配的 0.0-1.0 质量信号。它从整体上捕捉科学严谨性:
- 实验是否产生了真实的测量数据?
- 结果是否与现有方法进行了比较?
- 方法论是否可复现?
- 结果是否支持一个清晰的科学论断?
LLM 决定权重。ARI 只读取数值。
为什么选择 MCP?
Model Context Protocol 赋予 ARI 三个特性:
- 隔离性:每个技能是一个独立进程。论文生成中的错误不会破坏 HPC 作业。
- 可替换性:替换任何技能无需触及其他技能。
- 可发现性:LLM 智能体在运行时发现可用工具。添加技能 = 新功能,无需重新编程智能体。
通向物理世界的路径
当前的技能集覆盖数字计算。MCP 架构的设计是为了扩展:
Sensor reading → ari-skill-sensor
Actuator control → ari-skill-robot
Lab automation → ari-skill-labware
Real-time feedback → ari-skill-controlBFTS 智能体将使用与当今优化实验参数相同的基础设施来优化物理参数 — 反应温度、机器人速度、混合比例。
非目标
ARI 明确不以以下为设计目标:
- 替代领域专业知识(它是放大器)
- 在物理风险边界上无人监督运行
- 成为黑盒(每个决策都被记录并可追溯)
- 对任何特定领域的"好科学"有硬编码的看法
推论:失败的实验也是信息
当一个节点失败时,ARI 不会重试相同的方法。相反,失败的节点进入 frontier,expand() 生成继承了失败上下文的 debug 子节点。下一代从失败中学习 — 这与重试逻辑有本质区别,后者将失败视为噪声而非信号。
推论:可复现性是第一性原则
ARI 的智能体系统提示包含一条通用科学原则:确保你的实验是可复现的。这不是领域规则 — 它同样适用于化学、HPC 和机器学习。智能体自主决定需要捕获什么信息。论文审稿人随后独立评估论文是否可复现,从而形成闭环,不依赖任何硬编码的标准。