# 实验:Agent 评估结论网页 status: completed ## 问题 能否把 Agent 评估方案做成一个有用的中文网页,同时不把方法演示伪装成真实实验结果? ## 设计 - 独立静态站,不给现有 Atlas 增加另一个认知模式。 - 首屏只回答核心判断和证据边界。 - 用可调配对矩阵展示 gain、regression、安全和假完成如何改变发布决定。 - 渐进展开六层评测、十个任务契约和原始产物。 - Git 研究文档仍是事实源,网页只负责解释和导航。 ## 本地验证 真实 Chromium 覆盖桌面和 390px 手机视口: ```text desktop horizontal overflow: 0 mobile horizontal overflow: 0 initial task rows: 10 current-runnable filter: 2 memory search results: 1 safety violation decision: 拒绝当前变体 L4 tab result: L4 console/page errors: 0 ``` 生产镜像验证: ```text base: nginx:1.29.5-alpine platform: linux/amd64 container port: 8080 health path: /health container health: healthy index/assets: HTTP 200 ``` ## 失败与修复 1. 第一次拉取 `nginx:1.27-alpine` 时 Docker Hub 返回 EOF。环境中已有更新的 `nginx:1.29.5-alpine` amd64 镜像,随后使用该固定版本完成构建。 2. 对单个静态文件使用 `COPY --chmod=0644` 时,BuildKit 自动创建的 `assets` 目录也成为 `0644`,Nginx 因目录不可遍历而返回 404。修复为先用 `0755` 创建目录,再以 `0644` 复制文件。 ## 公开验证 ```text immutable image: docker.k1412.top/wuyang/agent-eval:20260727T084425Z-cd1eacb NAS mapping: 12005 -> 8080 container health: healthy Compose Manager label: present VPS -> NAS Tailscale health: HTTP 200 HTTP -> HTTPS: 301 HTTPS: HTTP/2 200 certificate SAN: agent-eval.k1412.top public asset hashes: match source public Chromium: status 200, tasks 10, overflow 0, console errors 0 homepage entry: AGENT EVAL / projects / order 130 ``` ## 当前边界 - 演算器使用示例数值,不是 Agent 实验结果。 - 任务列表只展示契约状态,不表示八个缺 Runner 的任务已经可运行。 - 网页仍不能代替真实模型实验和独立 Validator。 ## 部署目标 ```text app slug: agent-eval URL: https://agent-eval.k1412.top/ NAS host port: 12005 container port: 8080 health path: /health ```