Files
agent/experiments/operations/2026-07-27-agent-eval-site.md
T
2026-07-27 16:49:44 +08:00

2.2 KiB

实验:Agent 评估结论网页

status: completed

问题

能否把 Agent 评估方案做成一个有用的中文网页,同时不把方法演示伪装成真实实验结果?

设计

  • 独立静态站,不给现有 Atlas 增加另一个认知模式。
  • 首屏只回答核心判断和证据边界。
  • 用可调配对矩阵展示 gain、regression、安全和假完成如何改变发布决定。
  • 渐进展开六层评测、十个任务契约和原始产物。
  • Git 研究文档仍是事实源,网页只负责解释和导航。

本地验证

真实 Chromium 覆盖桌面和 390px 手机视口:

desktop horizontal overflow: 0
mobile horizontal overflow: 0
initial task rows: 10
current-runnable filter: 2
memory search results: 1
safety violation decision: 拒绝当前变体
L4 tab result: L4
console/page errors: 0

生产镜像验证:

base: nginx:1.29.5-alpine
platform: linux/amd64
container port: 8080
health path: /health
container health: healthy
index/assets: HTTP 200

失败与修复

  1. 第一次拉取 nginx:1.27-alpine 时 Docker Hub 返回 EOF。环境中已有更新的 nginx:1.29.5-alpine amd64 镜像,随后使用该固定版本完成构建。
  2. 对单个静态文件使用 COPY --chmod=0644 时,BuildKit 自动创建的 assets 目录也成为 0644,Nginx 因目录不可遍历而返回 404。修复为先用 0755 创建目录,再以 0644 复制文件。

公开验证

immutable image: docker.k1412.top/wuyang/agent-eval:20260727T084425Z-cd1eacb
NAS mapping: 12005 -> 8080
container health: healthy
Compose Manager label: present
VPS -> NAS Tailscale health: HTTP 200
HTTP -> HTTPS: 301
HTTPS: HTTP/2 200
certificate SAN: agent-eval.k1412.top
public asset hashes: match source
public Chromium: status 200, tasks 10, overflow 0, console errors 0
homepage entry: AGENT EVAL / projects / order 130

当前边界

  • 演算器使用示例数值,不是 Agent 实验结果。
  • 任务列表只展示契约状态,不表示八个缺 Runner 的任务已经可运行。
  • 网页仍不能代替真实模型实验和独立 Validator。

部署目标

app slug: agent-eval
URL: https://agent-eval.k1412.top/
NAS host port: 12005
container port: 8080
health path: /health