E 编辑 · ← → 翻页
Praxist·Research Orchestrator 2026-08-04 → 08-06
01 / 16
Technical Report · v1
P.
Praxist · 自主 R&D

让研究循环
可信 · 可复现


在 100 篇冻结 arXiv AI Agent 论文上的 cohort同代 Peer 组:一个 generation 内并行运行的多个 AI 研究工作者 闭环与 RAG 质量分层信号——一条不可伪造的研究证据链。

Internal Technical Report v1 · 2026-08-06
02·Problem Pain Point
PAIN
核心痛点

多 Agent 并行 自主 R&D

Single Agent
跑 → 出结果 → 结束
只是"实验"
Multi-Agent · 无协调
跑 × N → 各自结果
仍是"重复",不是"研究"
Praxist · 多代循环
假设 → 验证 → finding → frontier → 下一代
跨代继承的可审计证据链

Agent 自己拼路径、自己写 summary、自己挑策略 → 不可复现、可伪造

03·Positioning What Praxist Is
POSITION
Praxist 的定位

Research Orchestrator

  • 不是 RAG 系统
  • 不是模型
  • 不是 benchmark
是把研究循环组织成
solution lineage解决方案谱系:跨代累积的假设、尝试、finding 和 frontier 证据链 的 orchestrator
Hypotheses
Attempts
Findings
Frontier
PI / Chair
Experiments

输出不是单个 code diff,是跨代继承的可审计证据链

04·Task 100 Papers · 4,359 Chunks
TASK
实验任务

100 篇 AI Agent 论文 RAG

冻结语料

论文数100 篇 arXiv
canonical chunks规范化分块:按页面边界切分的、带 page 标记的独立检索单元4,359
空 / 超长 chunk0 / 0
PDF 总大小≈ 506 MiB
冻结时间戳2026-08-04T03:31:09Z

基础设施

EmbeddingQwen3-Embedding-4B
维度 / 归一化2,560 · L2 normalize
向量库Milvus FLAT / COSINE
collectionpraxist_agent_papers_qwen3e4b_v1
分块参数4,500 / 重叠 500 / ±700
05·Evaluation Three-Tier Split
SPLITS
评测三层划分

Dev / Blind / Hidden 防过拟合

Dev
调策略、调参、出信号。
实验者可反复看、反复试。
● 实验者可见
Blind
一次性最终评测。
不能用来调参。
● 一次性可见
fact-family 物理隔离——同一事实、同一方法、同一 evidence答必证据 chunk:query 的 ground-truth 相关文本段 不跨 split。隔离不靠 prompt 约定,靠 fact family 表强制。
06·Trust Unforgeable Evidence Chain
TRUST
信任边界

不可伪造的 证据链

01
Trusted Evaluator 独立服务
Unix socket + HMAC基于哈希的消息认证码:用密钥对消息生成签名,验证消息未被篡改且来自持有密钥的发送方 receipt,Peer 不可直连。
02
Peer 三不可读
不可读 qrelsquery relevance 标注集:每条 query 对应的 ground-truth chunk 相关性判断,不可直连 Milvus,不可读模型密钥。
03
Root-only Finding 发布
Finding 物化必须由 root-only trusted publisher 触发,Peer 不能自写。
04
路径绑定 HMAC
Strategy hash + variant + output_dir 绑定进 HMAC 签名,路径漂移即拒绝。
边界即产品 · The boundary IS the product
07·Phase A 2026-08-04 · Infrastructure Freeze
FREEZE
阶段一 · 基础设施冻结

2026-08-04 · 全冻结、可复现

01

语料冻结

100 篇 PDF + Markdown + 4,359 chunks + SHA-256 manifest用 SHA-256 哈希值登记每个文件内容的清单,任何改动都会让哈希变化,从而被检测

✓ 100 / 100 / 100
02

向量库验收

Milvus collection 4,359 条,FLAT / COSINE 合同通过,embedding 维度 2,560 一致。

✓ Contract verified
03

评测边界上线

Trusted evaluator 服务化,Unix socket + HMAC key 部署完毕,Peer 隔离策略生效。

✓ Service online
实验环境全冻结 · 可复现 · 禁止运行时连 arXiv
08·Phase B Cohort Closed Loop
COHORT
阶段二 · 真实 Cohort 闭环

2026-08-06 · 1G × 3P

Run: cohort-1g3p-20260806T1220 Runtime: deepseek Result: 3/3 receipt 验签通过 耗时: ~107s
Peer 策略 Receipt / Gate nDCG@10 Recall@10 Evidence cov P95 (ms)
gen0_peer0 dense-baseline-v1 SUCCEEDED / PASS 0.4170 0.3795 0.875 5028
gen0_peer1 p1-context-expand-v1 INCOMPLETE 0.3013 0.3515 1.000 5349
gen0_peer2 p1-paper-diverse-v1 INCOMPLETE 0.2260 0.2314 0.750 5824

variant + output + strategy 经单一 run-local assignment manifest 注入 · 控制面耗时 ~107s

09·Value 1 Zero Noise Across Modes
REPEAT
价值证明(一)· 编排无噪声

跨日期、跨模式 数字一致

Dense baseline 三次复现 完全一致
Praxist 编排层没有引入噪声——无论是否走 Agent、是否并行,结果可复现。
来源 日期 nDCG@10 Recall@10 Evid cov
Agent control smoke 2026-08-05 0.4170 0.3795 0.875
QUICK_POC_PARALLEL 2026-08-06 0.4170 0.3795 0.875
Cohort 1G3P
Agent 真实闭环
2026-08-06 0.4170 0.3795 0.875
10·Value 2 Unforgeable Trust Chain
TRUST
价值证明(二)· 信任链不可绕过

三层 HMAC + 一次性 admission

评测前

预登记

variant + output_dir + strategy hash 预登记 → admission lease准入租约:评测前预登记的一次性许可,原子消费、daemon 重启后不会重新放行 原子消费

评测中

路径绑定签名

evaluator 用 HMAC key 对 variant + output + 指标签名,生成路径绑定 receipt

评测后

Root-only 发布

trusted publisher 验证 HMAC、key ID、路径后发布 finding;越权 / 伪造即 fail-closed

8月6日 cohort · 3/3 receipt 验签通过 · 无伪造 · 无路径漂移 · 无重复提交
11·Signal 1 Strong · CI Entirely Below Zero
SIGNAL 1
RAG 质量信号 · 强信号

P2 rerank 把 hard-negative 误召回降低 18.3pp

策略 FP rate 95% CI
P1 Dense 0.2547
P2 + DashScope rerank 0.0718 [-0.237, -0.131]

指标 · hard-negative FP硬负例误召回率:被策略判为相关、实际标注为对抗性负例的 chunk 占比,越低越好 · paired bootstrap · 60 条 Dev

解读

CI 整个区间在 0 以下 → 统计可信的确定收益

rerank 在过滤"看似相关实则无关"的 chunk 上有真实效果——这正是 RAG 系统在生产中最常见的故障模式。

12·Signal 2 Engineering · Recall Maxed
SIGNAL 2
RAG 质量信号 · 工程信号

Context-expand 把 evidence coverage 拉满到 1.000

策略 Evidence cov nDCG@10
P1 Dense baseline 0.875 0.4170
P1 Context-expand 1.000 0.3013

指标 · EvidenceCoverage@40964,096 token 上下文窗口覆盖到全部答必证据 chunk 的比例

解读 · 已知代价不掩盖

扩大上下文窗口能覆盖到 全部 答必证据——适合"召回优先 / 容忍精度下降"的下游场景。

代价:nDCG 略降,精度被稀释。在 slides 上明确呈现。

13·Signal 3 Pending · CI Crosses Zero
SIGNAL 3
RAG 质量信号 · 待加强信号

P2 nDCG 点估计正向 · CI 待收紧

指标 P1 P2 Δ 95% CI
nDCG@10 0.3807 0.4289 +0.041 [-0.065, +0.149]
Recall@5 0.5294 0.5490 +0.017

macro nDCG@10 · 60 条 Dev · paired bootstrap配对自助法:对同一组 query 的两个策略结果做配对重采样,估计指标差异的置信区间

解读 · 方向正确,待扩样本

点估计正向,方向正确

当前 60 query 样本 CI 跨 0,未达统计显著。扩到 30/60 Dev 并跑 Blind 后,CI 收紧有望达标。

14·Panorama Full Picture on 60-Dev
ALL
指标全景

60 条 Dev 上的 完整对比

指标 P1 Dense P2 + rerank Δ 信号强度
macro nDCG@10 0.3807 0.4289 +0.041 方向正 / 待加强
Recall@5 0.5294 0.5490 +0.017 弱正
Recall@10 0.5784 0.5490 -0.025 略负
hard-negative FP 0.2547 0.0718 -0.183 强 · CI 全负
Evidence coverage 0.706 0.647 -0.050 略负
P95 延迟 (P1) 4472 ms
60× embedding 成本 $0.0000537
15·Next From Signal to Conclusion
NEXT
从信号到结论 · 三步加强

本次已交付 · 下一步加强

已交付

  • 基础设施冻结
    100 论文 · Milvus · evaluator
  • 真实 cohort 闭环
    1×3 · 3/3 receipt 验签
  • 分层 RAG 质量信号
    强 / 工程 / 待加强

三个加强动作

  1. 扩量 · 30/60-query Dev,收紧 nDCG CI 到显著区
  2. 盲测 · Blind 一次性评测 + 人工裁决升级 qrels 到 adjudicated
  3. 多代 · 触发正式 2 generations × 3 peers,验证跨代 frontier 继承
16·Closing Summary
END
总结

Praxist 让自主 R&D
可信 · 可复现 · 可分层


01
基础设施 + 编排闭环 已通过验收,跨日期跨模式数字一致。
02
RAG 质量信号分层:hard-negative FP 强信号、evidence coverage 工程信号、nDCG 方向正向待加强。
03
下一步明确:扩量 + 盲测 + 多代 → 把待加强升级为显著,把显著升级为可推广。
Praxist · Internal Technical Report · v1 2026-08-06 · END