# 实验:Agent 评估结论网页 status: validated-local ## 问题 能否把 Agent 评估方案做成一个有用的中文网页,同时不把方法演示伪装成真实实验结果? ## 设计 - 独立静态站,不给现有 Atlas 增加另一个认知模式。 - 首屏只回答核心判断和证据边界。 - 用可调配对矩阵展示 gain、regression、安全和假完成如何改变发布决定。 - 渐进展开六层评测、十个任务契约和原始产物。 - Git 研究文档仍是事实源,网页只负责解释和导航。 ## 本地验证 真实 Chromium 覆盖桌面和 390px 手机视口: ```text desktop horizontal overflow: 0 mobile horizontal overflow: 0 initial task rows: 10 current-runnable filter: 2 memory search results: 1 safety violation decision: 拒绝当前变体 L4 tab result: L4 console/page errors: 0 ``` 生产镜像验证: ```text base: nginx:1.29.5-alpine platform: linux/amd64 container port: 8080 health path: /health container health: healthy index/assets: HTTP 200 ``` ## 失败与修复 1. 第一次拉取 `nginx:1.27-alpine` 时 Docker Hub 返回 EOF。环境中已有更新的 `nginx:1.29.5-alpine` amd64 镜像,随后使用该固定版本完成构建。 2. 对单个静态文件使用 `COPY --chmod=0644` 时,BuildKit 自动创建的 `assets` 目录也成为 `0644`,Nginx 因目录不可遍历而返回 404。修复为先用 `0755` 创建目录,再以 `0644` 复制文件。 ## 当前边界 - 演算器使用示例数值,不是 Agent 实验结果。 - 任务列表只展示契约状态,不表示八个缺 Runner 的任务已经可运行。 - 公开部署和首页注册完成后再把本记录升级为 `completed`。 ## 部署目标 ```text app slug: agent-eval URL: https://agent-eval.k1412.top/ NAS host port: 12005 container port: 8080 health path: /health ```