Record completion research site deployment
This commit is contained in:
@@ -12,6 +12,7 @@
|
||||
| OPS-001 | 完整仓库交接可以让无会话上下文的 AI 继续工作 | completed | 增加状态、历史、下一步、完整性检查、模型校验和 systemd 服务管理 | [记录](operations/2026-07-12-project-handoff-audit.md) |
|
||||
| EVAL-001 | 现有运行事件和隔离工作区可扩展为可决策的 Agent 评测体系 | completed | 形成任务契约、分层评测、独立判分、gain/regression 对照和评分器;尚未运行真实模型 | [记录](agent-evaluation/2026-07-27-k1412-agent-evaluation-design.md) |
|
||||
| OPS-002 | 评估结论可以用交互报告展示而不伪装成真实跑分 | completed | 中文报告、决策演算器、任务筛选、响应式和镜像验证通过,已部署 HTTPS 并注册首页 | [记录](operations/2026-07-27-agent-eval-site.md) |
|
||||
| OPS-003 | 全文研究产物可以先作为网页文档阅读,而不提前设计知识产品 | completed | 完成研究正文、双链模型、37 篇证据索引和旧报告归档,并更新原 HTTPS 部署 | [记录](operations/2026-07-28-completion-research-document.md) |
|
||||
|
||||
## Experiment Rules
|
||||
|
||||
|
||||
@@ -0,0 +1,110 @@
|
||||
# 实验:Agent 完成研究文档网页
|
||||
|
||||
status: completed
|
||||
date: 2026-07-28
|
||||
owner: Codex + user
|
||||
|
||||
## 问题
|
||||
|
||||
能否把 `research/completion-verification/` 的研究结论和证据账本做成更容易连续阅读和深入核查
|
||||
的网页,同时不提前决定未来知识产品的网站形态?
|
||||
|
||||
## 边界
|
||||
|
||||
- 这是文档呈现,不是新的 Agent 产品。
|
||||
- 不运行 Agent benchmark,不生成新的实验数字。
|
||||
- 不让网页结论强于 Markdown 事实源。
|
||||
- 旧的 v1 评测说明页必须保留。
|
||||
- 系统推论必须继续标记为未验证。
|
||||
|
||||
## 实现
|
||||
|
||||
首页按阅读顺序组织:
|
||||
|
||||
```text
|
||||
核心判断
|
||||
-> 八条结论
|
||||
-> 具体能力拆解
|
||||
-> 完成证明 / 失败恢复双链
|
||||
-> 八条论证与边界
|
||||
-> 2023-2026 进展
|
||||
-> 未验证系统推论
|
||||
-> 37 篇证据账本
|
||||
-> 未知问题和可反驳预测
|
||||
```
|
||||
|
||||
证据浏览器支持:
|
||||
|
||||
- 中文/英文/数字全文搜索;
|
||||
- `core / support / context` 级别筛选;
|
||||
- 完成证明、协议审计、失败恢复、风险可靠性主题筛选;
|
||||
- 单条或当前结果批量展开;
|
||||
- 每篇直接打开 arXiv 原文。
|
||||
|
||||
`evaluation-site/build_research_data.py` 从 Markdown 账本生成浏览器数据。
|
||||
`tools/check_project.py` 检查源文件 SHA-256,以及:
|
||||
|
||||
```text
|
||||
full-text pool: 40
|
||||
audited: 37
|
||||
core: 26
|
||||
support: 11
|
||||
context: 3
|
||||
```
|
||||
|
||||
旧页面保留在 `/evaluation-v1.html`。
|
||||
|
||||
## 本地验证
|
||||
|
||||
真实 Google Chrome:
|
||||
|
||||
```text
|
||||
desktop viewport: 1440 x 1000
|
||||
mobile viewport: 390 x 844
|
||||
desktop overflow: 0
|
||||
mobile overflow: 0
|
||||
console/page errors: 0
|
||||
rendered evidence records: 40
|
||||
core filter records: 26
|
||||
search "恢复" within core: 6
|
||||
batch expand: 6/6
|
||||
archived page: HTTP 200
|
||||
```
|
||||
|
||||
本地生产镜像:
|
||||
|
||||
```text
|
||||
base: nginx:1.29.5-alpine
|
||||
container port: 8080
|
||||
health: healthy
|
||||
root/archive/assets: HTTP 200
|
||||
```
|
||||
|
||||
## 公开部署
|
||||
|
||||
```text
|
||||
app slug: agent-eval
|
||||
immutable image: docker.k1412.top/wuyang/agent-eval:20260727T165727Z-4c88faa
|
||||
NAS mapping: 12005 -> 8080
|
||||
public URL: https://agent-eval.k1412.top/
|
||||
archive URL: https://agent-eval.k1412.top/evaluation-v1.html
|
||||
health: /health
|
||||
```
|
||||
|
||||
已验证:
|
||||
|
||||
- Unraid Compose Manager 管理标签与容器健康;
|
||||
- VPS 到 NAS Tailscale 返回 200;
|
||||
- HTTP 到 HTTPS 返回 301;
|
||||
- HTTPS 使用 HTTP/2 并返回 200;
|
||||
- Let's Encrypt SAN 为 `agent-eval.k1412.top`;
|
||||
- 三个新静态资源的公网 SHA-256 与仓库一致;
|
||||
- 公网页面桌面/手机无横向溢出和浏览器错误;
|
||||
- 公网 recovery 主题为 12 条,进一步搜索“根因”为 2 条,展开 2/2;
|
||||
- 旧报告返回 200;
|
||||
- 首页条目保持 `AGENT EVAL / projects / order 130`。
|
||||
|
||||
## 当前判断
|
||||
|
||||
网页解决了“如何阅读本轮产物”,没有解决“未来知识系统应该是什么产品形态”。下一步仍是让
|
||||
用户使用该文档质疑结论、补反例和收窄边界,而不是继续增加交互或恢复评测实现。
|
||||
Reference in New Issue
Block a user