2.2 KiB
2.2 KiB
实验:Agent 评估结论网页
status: completed
问题
能否把 Agent 评估方案做成一个有用的中文网页,同时不把方法演示伪装成真实实验结果?
设计
- 独立静态站,不给现有 Atlas 增加另一个认知模式。
- 首屏只回答核心判断和证据边界。
- 用可调配对矩阵展示 gain、regression、安全和假完成如何改变发布决定。
- 渐进展开六层评测、十个任务契约和原始产物。
- Git 研究文档仍是事实源,网页只负责解释和导航。
本地验证
真实 Chromium 覆盖桌面和 390px 手机视口:
desktop horizontal overflow: 0
mobile horizontal overflow: 0
initial task rows: 10
current-runnable filter: 2
memory search results: 1
safety violation decision: 拒绝当前变体
L4 tab result: L4
console/page errors: 0
生产镜像验证:
base: nginx:1.29.5-alpine
platform: linux/amd64
container port: 8080
health path: /health
container health: healthy
index/assets: HTTP 200
失败与修复
- 第一次拉取
nginx:1.27-alpine时 Docker Hub 返回 EOF。环境中已有更新的nginx:1.29.5-alpineamd64 镜像,随后使用该固定版本完成构建。 - 对单个静态文件使用
COPY --chmod=0644时,BuildKit 自动创建的assets目录也成为0644,Nginx 因目录不可遍历而返回 404。修复为先用0755创建目录,再以0644复制文件。
公开验证
immutable image: docker.k1412.top/wuyang/agent-eval:20260727T084425Z-cd1eacb
NAS mapping: 12005 -> 8080
container health: healthy
Compose Manager label: present
VPS -> NAS Tailscale health: HTTP 200
HTTP -> HTTPS: 301
HTTPS: HTTP/2 200
certificate SAN: agent-eval.k1412.top
public asset hashes: match source
public Chromium: status 200, tasks 10, overflow 0, console errors 0
homepage entry: AGENT EVAL / projects / order 130
当前边界
- 演算器使用示例数值,不是 Agent 实验结果。
- 任务列表只展示契约状态,不表示八个缺 Runner 的任务已经可运行。
- 网页仍不能代替真实模型实验和独立 Validator。
部署目标
app slug: agent-eval
URL: https://agent-eval.k1412.top/
NAS host port: 12005
container port: 8080
health path: /health