1.8 KiB
1.8 KiB
实验:Agent 评估结论网页
status: validated-local
问题
能否把 Agent 评估方案做成一个有用的中文网页,同时不把方法演示伪装成真实实验结果?
设计
- 独立静态站,不给现有 Atlas 增加另一个认知模式。
- 首屏只回答核心判断和证据边界。
- 用可调配对矩阵展示 gain、regression、安全和假完成如何改变发布决定。
- 渐进展开六层评测、十个任务契约和原始产物。
- Git 研究文档仍是事实源,网页只负责解释和导航。
本地验证
真实 Chromium 覆盖桌面和 390px 手机视口:
desktop horizontal overflow: 0
mobile horizontal overflow: 0
initial task rows: 10
current-runnable filter: 2
memory search results: 1
safety violation decision: 拒绝当前变体
L4 tab result: L4
console/page errors: 0
生产镜像验证:
base: nginx:1.29.5-alpine
platform: linux/amd64
container port: 8080
health path: /health
container health: healthy
index/assets: HTTP 200
失败与修复
- 第一次拉取
nginx:1.27-alpine时 Docker Hub 返回 EOF。环境中已有更新的nginx:1.29.5-alpineamd64 镜像,随后使用该固定版本完成构建。 - 对单个静态文件使用
COPY --chmod=0644时,BuildKit 自动创建的assets目录也成为0644,Nginx 因目录不可遍历而返回 404。修复为先用0755创建目录,再以0644复制文件。
当前边界
- 演算器使用示例数值,不是 Agent 实验结果。
- 任务列表只展示契约状态,不表示八个缺 Runner 的任务已经可运行。
- 公开部署和首页注册完成后再把本记录升级为
completed。
部署目标
app slug: agent-eval
URL: https://agent-eval.k1412.top/
NAS host port: 12005
container port: 8080
health path: /health