From 36c2499d3ce82a224ea030a5fb28c589c2cc8301 Mon Sep 17 00:00:00 2001 From: wuyang <5700876+banisherwy@user.noreply.gitee.com> Date: Wed, 8 Jul 2026 11:25:52 +0800 Subject: [PATCH] Add industry collection and six-month job tracking --- README.md | 6 +- docs/00-knowledge-map.md | 2 + docs/05-collection-workflow.md | 88 ++++++++++++++++++++++----- industry/README.md | 35 +++++++++++ industry/company-watchlist.md | 31 ++++++++++ industry/industry-insights.md | 53 +++++++++++++++++ industry/items/README.md | 17 ++++++ industry/schema.md | 105 +++++++++++++++++++++++++++++++++ industry/source-registry.md | 67 +++++++++++++++++++++ jobs/README.md | 10 ++++ jobs/market-insights.md | 8 ++- jobs/schema.md | 17 ++++++ jobs/source-registry.md | 10 +++- papers/README.md | 2 + papers/source-registry.md | 18 +++++- references/README.md | 1 + templates/README.md | 1 + templates/industry-note.md | 89 ++++++++++++++++++++++++++++ templates/jd-note.md | 13 ++++ 19 files changed, 550 insertions(+), 23 deletions(-) create mode 100644 industry/README.md create mode 100644 industry/company-watchlist.md create mode 100644 industry/industry-insights.md create mode 100644 industry/items/README.md create mode 100644 industry/schema.md create mode 100644 industry/source-registry.md create mode 100644 templates/industry-note.md diff --git a/README.md b/README.md index 768bc5b..5e0ef07 100644 --- a/README.md +++ b/README.md @@ -11,10 +11,11 @@ - [Architecture Patterns](docs/02-architecture-patterns.md): 常见 Agent 架构与选型判断 - [Practice Playbook](docs/03-practice-playbook.md): 从需求到上线的实践清单 - [Evaluation and Observability](docs/04-evaluation-observability.md): 评估体系、指标、日志和回归 -- [Collection Workflow](docs/05-collection-workflow.md): JD 和论文的持续收集流程 +- [Collection Workflow](docs/05-collection-workflow.md): JD、论文和行业实践的持续收集流程 - [Glossary](docs/99-glossary.md): 统一术语表 - [Jobs](jobs/README.md): 北京大厂 Agent / LLM 相关岗位要求 - [Papers](papers/README.md): Agent 相关论文、阅读队列和研究洞察 +- [Industry](industry/README.md): 大公司 Agent 工作、技术报告和工程博客 - [Projects](projects/README.md): 项目目录、项目记录和复盘 - [Experiments](experiments/README.md): 实验台账、假设、结果和决策 - [References](references/README.md): 文章、开源项目、课程和产品文档 @@ -36,7 +37,8 @@ 3. 验证一个想法:用 [experiment-note](templates/experiment-note.md) 记录假设和结果。 4. 收集一条岗位:用 [jd-note](templates/jd-note.md) 提取岗位要求和能力信号。 5. 读一篇论文:用 [paper-note](templates/paper-note.md) 提炼可迁移结论。 -6. 有稳定结论后,把它合并到 `docs/` 的对应主题页。 +6. 看到大公司 Agent 实践:用 [industry-note](templates/industry-note.md) 提取技术和产品信号。 +7. 有稳定结论后,把它合并到 `docs/` 的对应主题页。 ## Status Labels diff --git a/docs/00-knowledge-map.md b/docs/00-knowledge-map.md index 877c2dc..2e811e9 100644 --- a/docs/00-knowledge-map.md +++ b/docs/00-knowledge-map.md @@ -14,6 +14,7 @@ Agent 知识可以按“问题层级”整理,而不是按资料来源堆放 | 评估 | 怎么判断 Agent 是否可靠 | 测试集、指标、观测和回归 | | 岗位 | 市场正在要求什么 Agent 能力 | JD 笔记、技能趋势、能力缺口 | | 论文 | 研究里哪些方法和证据值得吸收 | 阅读队列、论文笔记、研究洞察 | +| 行业 | 大公司正在怎么落地 Agent | 技术报告、工程博客、产品实践、公司趋势 | | 资料 | 外部知识如何沉淀为判断 | 文章摘要、项目阅读、课程和文档笔记 | ## Taxonomy @@ -60,6 +61,7 @@ Agent 知识可以按“问题层级”整理,而不是按资料来源堆放 - `incident`: 来自失败案例或线上问题 - `job`: 来自岗位要求和市场信号 - `paper`: 来自研究论文和 benchmark +- `industry`: 来自大公司技术报告、工程博客、产品发布和代码仓库 ## Maturity Model diff --git a/docs/05-collection-workflow.md b/docs/05-collection-workflow.md index a2f224f..06998ed 100644 --- a/docs/05-collection-workflow.md +++ b/docs/05-collection-workflow.md @@ -1,6 +1,6 @@ # Collection Workflow -这个文档定义我如何帮你持续收集 JD 和论文。 +这个文档定义我如何帮你持续收集 JD、论文和大公司 Agent 实践资料。 核心原则:先让资料稳定进入知识库,再逐步自动化;不要一开始为了自动化牺牲判断质量。 @@ -10,7 +10,7 @@ 你给我链接、截图、岗位描述、论文标题或 PDF,我负责: -- 判断它应该进入 `jobs/`、`papers/` 还是 `references/`。 +- 判断它应该进入 `jobs/`、`papers/`、`industry/` 还是 `references/`。 - 提取结构化 metadata。 - 建立 Markdown 笔记。 - 打标签和关联已有知识。 @@ -21,6 +21,7 @@ - 你平时看到的单条 JD。 - 朋友转来的内推信息。 - 某篇你觉得重要的论文。 +- 大公司发布的 Agent 技术报告、工程博客、产品文档或代码仓库。 - 临时想整理的一批资料。 ### 2. Live Web Sweep @@ -30,10 +31,11 @@ 例子: ```text -收集最近北京大厂 Agent 岗位 +收集最近 6 个月北京大厂 Agent 岗位 找最近三个月 Agent evaluation 相关论文 整理 DeepSeek 和腾讯的大模型应用岗位要求 找 coding agent 方向值得读的 10 篇论文 +整理 OpenAI、Anthropic、Google DeepMind 最近的 Agent 技术报告和博客 ``` 我会做: @@ -42,8 +44,8 @@ 2. 在线检索:优先官方来源,其次可信平台和社区线索。 3. 去重:按标题、公司、岗位、URL、日期或论文 DOI/arXiv ID 去重。 4. 记录来源:每条资料都保留 `source_url` 和 `collected_at`。 -5. 结构化:生成 `jobs/items/` 或 `papers/items/` 笔记。 -6. 提炼判断:更新 `market-insights.md` 或 `paper-insights.md`。 +5. 结构化:生成 `jobs/items/`、`papers/items/` 或 `industry/items/` 笔记。 +6. 提炼判断:更新 `market-insights.md`、`paper-insights.md` 或 `industry-insights.md`。 7. 回流知识:标记需要更新的 `docs/`、`experiments/`、`projects/`。 ### 3. Batch Import @@ -54,6 +56,7 @@ - 招聘网站搜索结果。 - arXiv 搜索结果。 +- 公司博客和技术报告链接合集。 - 论文清单。 - 朋友发来的岗位合集。 @@ -69,7 +72,8 @@ - 生成搜索、筛选、时间线和标签页。 - 定期检查 JD 是否过期。 - 定期拉取论文搜索结果。 -- 把 JD 技能和论文 topic 做关联图谱。 +- 定期检查大公司 Agent 技术博客、报告和代码发布。 +- 把 JD 技能、论文 topic 和行业实践做关联图谱。 ## JD Collection @@ -77,10 +81,13 @@ 默认范围: +- time window: 滚动最近 6 个月,优先全量收集范围内岗位 - location: 北京 - companies: DeepSeek、腾讯、字节、阿里、百度、美团、快手、京东、小米、智谱、月之暗面 - keywords: Agent、大模型、LLM、RAG、智能体、模型评估、AI Infra、代码智能、AI 产品 +JD 收集的主要目标是观察需求变化,而不是只抓最新岗位。每轮收集都要尽量保留快照,后续用同公司、同岗位、同能力标签的变化来判断趋势。 + ### Source Priority 1. 公司官方招聘站和官方发布。 @@ -95,6 +102,7 @@ - raw items: `jobs/items/*.md` - trend update: `jobs/market-insights.md` - taxonomy update: `jobs/skill-taxonomy.md` +- change notes: 同类岗位在最近 6 个月内的技能、职责、级别和业务方向变化 ### JD Extraction Focus @@ -111,7 +119,7 @@ ### Example Prompt ```text -收集本周北京 DeepSeek、腾讯、字节的 Agent / LLM 应用岗位,优先官方来源,每家公司至少 3 条,如果官方不足再补招聘平台。 +收集最近 6 个月北京 DeepSeek、腾讯、字节的 Agent / LLM 应用岗位,优先官方来源;如果官方不足,再补招聘平台和社区线索,重点分析要求变化。 ``` ## Paper Collection @@ -130,7 +138,11 @@ - Human-in-the-loop - Computer use -### Source Priority +### Source Policy + +论文来源需要先确认,再进入持续收集。默认我会先提出候选来源清单,由你确认为 `approved` 后再做系统性 sweep。 + +### Candidate Source Priority 1. 论文原始页面、arXiv、OpenReview、ACL Anthology。 2. 会议 proceedings。 @@ -163,14 +175,55 @@ 找最近 6 个月 Agent evaluation 方向最值得读的论文,优先有 benchmark 或代码的,整理成 reading queue。 ``` +## Industry Collection + +### Scope + +默认收集大公司和重要 AI 团队的 Agent 工作: + +- frontier labs: OpenAI、Anthropic、Google DeepMind、Microsoft、Meta、Amazon、NVIDIA +- China AI teams: DeepSeek、腾讯、字节 Seed、阿里 Qwen、百度、智谱、月之暗面 +- material types: 技术报告、研究博客、工程博客、产品文档、代码仓库、benchmark、开发者大会材料 + +### Source Priority + +1. 官方技术报告、官方研究页、官方工程博客、官方产品文档。 +2. 官方 GitHub、Hugging Face、模型卡和 benchmark 页面。 +3. 官方演讲、开发者大会、发布会文字稿。 +4. 可信第三方深度分析,只作为线索或补充。 + +### Output + +每轮行业资料收集输出三类东西: + +- raw items: `industry/items/*.md` +- trend update: `industry/industry-insights.md` +- watchlist update: `industry/company-watchlist.md` + +### Industry Extraction Focus + +我会重点抽取: + +- 公司正在把 Agent 用在哪些产品场景。 +- 公开的架构、工具使用、记忆、评估、安全和部署信号。 +- 是否有技术报告、代码、benchmark 或只是产品宣传。 +- 和论文、JD、实验、项目之间的相互印证。 +- 对我们知识库和项目规划的启发。 + +### Example Prompt + +```text +收集最近 6 个月 OpenAI、Anthropic、Google DeepMind、Microsoft 的 Agent 技术报告和工程博客,按证据强度排序。 +``` + ## Cross-linking -JD 和论文必须互相打通。 +JD、论文和行业实践必须互相打通。 一个技能或概念最好能形成这样的链路: ```text -Job requirement -> Paper evidence -> Experiment validation -> Project practice -> Docs conclusion +Job requirement -> Paper evidence -> Industry practice -> Experiment validation -> Project practice -> Docs conclusion ``` 例子: @@ -179,6 +232,7 @@ Job requirement -> Paper evidence -> Experiment validation -> Project practice - agent-evaluation jobs: 哪些公司要求模型评估、Agent benchmark、线上观测 papers: 哪些论文定义评估方法和 benchmark + industry: 哪些公司公开了 Agent 评估、观测或安全实践 experiments: 我们能否复现实验或搭一个 eval harness projects: 哪些项目需要这套评估能力 docs: 稳定结论沉淀到 Evaluation and Observability @@ -193,16 +247,17 @@ agent-evaluation - 不确定的内容标记为 `unknown` 或 `needs verification`。 - 过期 JD 不删除,改状态并保留原因。 - 论文没有读完时只进入 queue,不伪装成已总结。 +- 行业资料要区分技术证据和产品宣传。 ## Review Rhythm 建议先用轻量节奏: -| Rhythm | JD | Papers | -| --- | --- | --- | -| Weekly | 新增岗位、明显变化 | 新论文线索、阅读队列 | -| Monthly | 市场技能趋势 | 主题研究洞察 | -| Quarterly | 能力缺口和学习路线 | 成熟结论回流 `docs/` | +| Rhythm | JD | Papers | Industry | +| --- | --- | --- | --- | +| Weekly | 最近 6 个月窗口内新增和变化 | 新论文线索、阅读队列 | 大公司新发布和技术报告 | +| Monthly | 市场技能趋势和需求变化 | 主题研究洞察 | 公司实践趋势 | +| Quarterly | 能力缺口和学习路线 | 成熟结论回流 `docs/` | 行业实践和项目规划复盘 | ## What I Need From You @@ -212,5 +267,8 @@ agent-evaluation - 是否只看北京。 - 是否看实习、校招、社招。 - 岗位偏工程、研究、产品还是综合。 +- JD 是否只收北京,或是否包含远程/杭州/深圳等强相关岗位。 +- 论文来源名单是否已经确认。 - 论文偏最新趋势、经典必读,还是能直接指导项目实现。 +- 行业资料优先看哪些公司和哪些产品方向。 - 每轮希望收集多少条。 diff --git a/industry/README.md b/industry/README.md new file mode 100644 index 0000000..2d7a313 --- /dev/null +++ b/industry/README.md @@ -0,0 +1,35 @@ +# Industry + +这里持续收集大公司和重要 AI 团队的 Agent 相关工作:产品发布、技术报告、研究博客、工程博客、代码仓库、benchmark 和实践复盘。 + +它和 `papers/` 的区别:`papers/` 关注研究证据,`industry/` 关注公司真实在做什么、怎么落地、暴露了哪些工程和产品趋势。 + +## Structure + +- [items](items/README.md): 每条公司工作一个 Markdown 文件 +- [schema](schema.md): 行业资料字段和写法 +- [source-registry](source-registry.md): 官方来源和可信来源清单 +- [company-watchlist](company-watchlist.md): 重点公司和团队 +- [industry-insights](industry-insights.md): 周期性趋势总结 + +## Collection Questions + +- 大公司正在把 Agent 用在哪些产品和场景? +- 它们公开了哪些系统设计、工具调用、记忆、评估、安全和部署经验? +- 哪些工作只是产品宣传,哪些有技术细节或可复现材料? +- 哪些行业实践能反哺我们的项目、实验和知识文档? +- 公司实践和 JD 要求、论文趋势之间是否互相印证? + +## Workflow + +1. 收集官方博客、技术报告、产品文档、代码仓库或演讲资料。 +2. 用 [industry-note](../templates/industry-note.md) 建立结构化笔记。 +3. 标注 company、source_type、topics、implementation_signals 和 evidence_level。 +4. 更新 [industry-insights](industry-insights.md)。 +5. 把稳定结论回流到 `docs/`、`papers/`、`jobs/`、`experiments/` 或 `projects/`。 + +## Initial Scope + +- frontier labs: OpenAI、Anthropic、Google DeepMind、Microsoft、Meta、Amazon、NVIDIA +- China AI teams: DeepSeek、腾讯、字节 Seed、阿里 Qwen、百度、智谱、月之暗面 +- product areas: coding agent、computer use、deep research、office agent、enterprise agent、agent safety、multi-agent、agent evaluation diff --git a/industry/company-watchlist.md b/industry/company-watchlist.md new file mode 100644 index 0000000..1f734f6 --- /dev/null +++ b/industry/company-watchlist.md @@ -0,0 +1,31 @@ +# Company Watchlist + +## Frontier Labs + +| Company | Focus | Priority | +| --- | --- | --- | +| OpenAI | Codex、computer use、deep research、agent productization、evaluation | P0 | +| Anthropic | Claude Code、computer use、tool use、安全、enterprise agent | P0 | +| Google DeepMind | Gemini agent、multi-agent safety、agent security、research reports | P0 | +| Microsoft | Copilot、Agent AI、software engineering agents、enterprise agent ecosystem | P0 | +| Meta | Llama、open models、agent frameworks、consumer AI | P1 | +| Amazon | Alexa、AWS agent services、industrial AI applications | P1 | +| NVIDIA | Agent systems、inference、robotics、accelerated deployment | P1 | + +## China AI Teams + +| Company / Team | Focus | Priority | +| --- | --- | --- | +| DeepSeek | reasoning、coding、open models、agent capabilities、infra | P0 | +| 字节 Seed | Doubao、Seed models、agent era、world models、AI infra | P0 | +| 阿里 Qwen | Qwen Agent、coding、multimodal agents、open models | P0 | +| 腾讯 | 混元、元宝、企业应用、游戏和内容场景、AI Lab | P0 | +| 百度 | 文心、搜索、智能云、Agent 应用 | P1 | +| 智谱 | GLM、Agent 平台、企业应用 | P1 | +| 月之暗面 | Kimi、长上下文、AI 助手 | P1 | + +## Review Rules + +- P0 每周扫一轮重大更新。 +- P1 每月扫一轮,除非出现明显热点。 +- 新公司先进入候选,连续出现高价值 Agent 信息后再提升优先级。 diff --git a/industry/industry-insights.md b/industry/industry-insights.md new file mode 100644 index 0000000..a604d3b --- /dev/null +++ b/industry/industry-insights.md @@ -0,0 +1,53 @@ +# Industry Insights + +status: seed + +这个文件沉淀大公司 Agent 工作和技术报告的趋势判断。单条资料放在 `industry/items/`,这里记录跨公司的归纳。 + +## Current Snapshot + +- date: +- scope: +- sources reviewed: + +## Strong Industry Signals + +- + +## Weak or Marketing-heavy Signals + +- + +## Company Patterns + +| Company | Agent Direction | Evidence | Notes | +| --- | --- | --- | --- | +| OpenAI | _TBD_ | _TBD_ | _TBD_ | +| Anthropic | _TBD_ | _TBD_ | _TBD_ | +| Google DeepMind | _TBD_ | _TBD_ | _TBD_ | +| Microsoft | _TBD_ | _TBD_ | _TBD_ | +| DeepSeek | _TBD_ | _TBD_ | _TBD_ | +| 腾讯 | _TBD_ | _TBD_ | _TBD_ | +| 字节 Seed | _TBD_ | _TBD_ | _TBD_ | +| 阿里 Qwen | _TBD_ | _TBD_ | _TBD_ | + +## Implementation Patterns + +- tool use: +- memory: +- evaluation: +- safety: +- deployment: +- productization: + +## Follow-up Queue + +- + +## Links Back to Knowledge Base + +- docs to update: +- papers to read: +- jobs to compare: +- experiments to create: +- projects affected: diff --git a/industry/items/README.md b/industry/items/README.md new file mode 100644 index 0000000..b3f9914 --- /dev/null +++ b/industry/items/README.md @@ -0,0 +1,17 @@ +# Industry Items + +每条公司工作一个文件,文件名建议: + +```text +YYYY-MM-DD-company-short-title.md +``` + +例子: + +```text +2026-07-08-openai-agents-transforming-work.md +2026-07-08-google-deepmind-agent-security.md +2026-07-08-qwen-agentworld.md +``` + +如果同一公司连续发布多个相关材料,优先拆成多条 item,再在 `industry-insights.md` 中做汇总。不要把多个来源混成一条笔记,否则后续很难追踪证据。 diff --git a/industry/schema.md b/industry/schema.md new file mode 100644 index 0000000..67ecf66 --- /dev/null +++ b/industry/schema.md @@ -0,0 +1,105 @@ +# Industry Schema + +行业资料笔记使用 YAML frontmatter 加正文。 + +## Frontmatter + +```yaml +--- +type: industry +company: +team: +title: +url: +source_name: +source_type: technical-report / research-blog / engineering-blog / product-blog / product-doc / code-release / benchmark / talk / other +source_quality: official / official-adjacent / secondary / unknown +published_at: +collected_at: YYYY-MM-DD +status: queued / summarized / analyzed / deprecated +topics: + - agent +implementation_signals: + - tool-use +product_area: + - coding-agent +models: + - +tools: + - +benchmarks: + - +related_papers: + - +related_jobs: + - +related_experiments: + - +related_projects: + - +evidence_level: high / medium / low +relevance: high / medium / low +--- +``` + +## Body + +```text +# - + +## One-line Takeaway + +一句话说明这条资料暴露了什么行业趋势或工程经验。 + +## Source Snapshot + +来源、发布日期、采集日期、来源质量。 + +## What They Built or Claimed + +公司发布了什么产品、系统、能力、报告或代码? + +## Technical Signals + +- architecture: +- tool use: +- memory: +- evaluation: +- safety: +- deployment: +- data: + +## Product and Business Signals + +- users: +- scenario: +- pricing / availability: +- go-to-market: + +## Evidence Quality + +判断它是强证据还是弱信号。是否有论文、技术报告、benchmark、代码或只是营销描述? + +## Links + +- papers: +- jobs: +- experiments: +- projects: +- docs: + +## Gaps for Us + +- + +## Notes + +- +``` + +## Field Rules + +- `url` 和 `collected_at` 必填。 +- 优先官方来源;二手来源只能作为线索。 +- `evidence_level` 和 `source_quality` 必须分开:官方产品博客也可能证据很弱。 +- 技术细节不足时标记为 `low`,不要强行推断实现。 diff --git a/industry/source-registry.md b/industry/source-registry.md new file mode 100644 index 0000000..b81b8a7 --- /dev/null +++ b/industry/source-registry.md @@ -0,0 +1,67 @@ +# Industry Source Registry + +这个文件记录大公司 Agent 工作、技术报告和工程博客的来源。 + +## Source Priority + +| Priority | Source Type | Use | +| --- | --- | --- | +| 1 | 官方研究页、官方博客、官方技术报告、官方文档 | 直接整理 | +| 2 | 官方 GitHub、Hugging Face、模型卡、benchmark 页面 | 直接整理,但注意版本 | +| 3 | 官方会议演讲、开发者大会、产品发布页 | 可整理,标注产品宣传成分 | +| 4 | 可信媒体访谈、第三方深度分析 | 作为线索或补充,不单独形成强结论 | + +## Candidate Official Sources + +这些来源可作为第一批候选。后续每次收集前可以按主题取子集。 + +| Company / Team | Source | URL | Notes | +| --- | --- | --- | --- | +| OpenAI | Research | https://openai.com/research/ | 研究论文、系统报告、agent 相关研究 | +| OpenAI | News / Index | https://openai.com/index/ | 产品、经济研究、发布博客 | +| Anthropic | Research | https://www.anthropic.com/research | 研究报告和安全材料 | +| Anthropic | News | https://www.anthropic.com/news | 产品发布、computer use、Claude 相关工作 | +| Google DeepMind | Blog | https://deepmind.google/blog/ | agent、安全、多 Agent、Gemini 相关博客 | +| Google DeepMind | Publications | https://deepmind.google/research/publications/ | 论文和技术报告索引 | +| Google Research | Blog | https://research.google/blog/ | 研究博客和系统实践 | +| Microsoft Research | Blog | https://www.microsoft.com/en-us/research/blog/ | Agent、安全、软件工程和研究博客 | +| Microsoft Research | Agent AI project | https://www.microsoft.com/en-us/research/project/agent-ai/ | Agent 项目页 | +| Meta AI | Blog | https://ai.meta.com/blog/ | Llama、agents、产品和研究发布 | +| Amazon Science | Home | https://www.amazon.science/ | 工业研究和应用论文 | +| NVIDIA Research | Home | https://research.nvidia.com/ | Agent、模型、系统研究 | +| NVIDIA Technical Blog | Blog | https://developer.nvidia.com/blog/ | 工程博客、部署和加速实践 | +| DeepSeek | Home / News | https://www.deepseek.com/ | 官方入口和岗位入口 | +| DeepSeek | GitHub | https://github.com/deepseek-ai | 模型、报告和代码发布 | +| ByteDance Seed | Home | https://seed.bytedance.com/en/ | Seed 团队入口 | +| ByteDance Seed | Research | https://seed.bytedance.com/en/research | 研究和技术发布 | +| ByteDance Seed | GitHub | https://github.com/ByteDance-Seed | 代码和项目发布 | +| Qwen | Blog | https://qwen.ai/blog | Qwen 模型、Agent 和技术博客 | +| Qwen | Hugging Face | https://huggingface.co/Qwen | 模型卡、发布和代码入口 | +| Alibaba Cloud | Blog | https://www.alibabacloud.com/blog | 阿里云工程博客和产品实践 | +| Tencent AI Lab | Home | https://ai.tencent.com/ailab/ | 腾讯 AI Lab 研究入口 | +| Baidu Research | Home | https://research.baidu.com/ | 百度研究入口 | + +## Collection Queries + +```text +site:openai.com/index agent technical report +site:anthropic.com/news computer use agent +site:deepmind.google/blog agent safety multi-agent +site:microsoft.com/en-us/research/blog agent evaluation +site:qwen.ai/blog agent coding +site:seed.bytedance.com/en agent LLM +site:github.com/deepseek-ai agent +site:ai.tencent.com/ailab agent large language model +``` + +## Collection Cadence + +- weekly: 新发布、重大产品或技术报告 +- monthly: 公司实践趋势和技术信号 +- quarterly: 行业实践和论文/JD/项目之间的交叉分析 + +## Quality Notes + +- 产品博客通常能说明方向,但不一定能说明实现。 +- 技术报告、代码和 benchmark 的证据强度更高。 +- 公司公开信息天然带宣传倾向,需要和论文、代码、实际产品体验或 JD 互相校验。 diff --git a/jobs/README.md b/jobs/README.md index 40a0846..db779d6 100644 --- a/jobs/README.md +++ b/jobs/README.md @@ -30,6 +30,16 @@ ## Initial Scope +- time window: 滚动最近 6 个月,优先全量收集范围内岗位 - location: 北京优先 - companies: DeepSeek、腾讯、字节、阿里、百度、美团、快手、京东、小米、商汤、智谱、月之暗面等 - role keywords: Agent、LLM、AIGC、大模型应用、RAG、AI Infra、模型评估、智能体、代码智能、AI 产品 + +## Primary Goal + +JD 收集的主要目标是观察岗位需求变化: + +- 同一公司是否从研究转向产品落地。 +- 同一岗位是否开始要求评估、数据飞轮、Agent 工程化或部署能力。 +- Agent 相关词汇是否从加分项变成硬性要求。 +- 北京岗位和其他城市岗位是否体现不同团队布局。 diff --git a/jobs/market-insights.md b/jobs/market-insights.md index 71db520..f5b7a55 100644 --- a/jobs/market-insights.md +++ b/jobs/market-insights.md @@ -7,10 +7,16 @@ status: seed ## Current Snapshot - date: -- scope: 北京,大厂 Agent / LLM 相关岗位 +- scope: 北京,大厂 Agent / LLM 相关岗位,滚动最近 6 个月 - sample size: - source mix: +## Requirement Changes + +| Period | Signal | Companies | Evidence | Notes | +| --- | --- | --- | --- | --- | +| _TBD_ | _TBD_ | _TBD_ | _TBD_ | _TBD_ | + ## High-frequency Skills | Skill | Count | Companies | Notes | diff --git a/jobs/schema.md b/jobs/schema.md index 2584de3..be4744a 100644 --- a/jobs/schema.md +++ b/jobs/schema.md @@ -15,6 +15,11 @@ source_name: source_quality: official / job-board / social / secondary / unknown collected_at: YYYY-MM-DD posted_at: +first_seen_at: +last_checked_at: +snapshot_type: new / changed / unchanged / expired +job_code: +previous_snapshot: status: active / expired / unknown level: team: @@ -48,6 +53,16 @@ relevance: high / medium / low 来源、采集日期、是否北京岗位、是否仍可访问。 +## Change Snapshot + +用于记录最近 6 个月窗口内的变化: + +- first_seen_at: +- last_checked_at: +- snapshot_type: +- previous_snapshot: +- changed_fields: + ## Raw JD Summary 用自己的话概括岗位职责、任职要求和加分项。不要无选择地复制长段原文。 @@ -91,6 +106,8 @@ relevance: high / medium / low - `source_url` 必填,除非来源是用户直接提供的截图或文本。 - `collected_at` 必填,因为 JD 是强时效资料。 +- `first_seen_at` 和 `last_checked_at` 用于追踪近 6 个月需求变化。 +- `snapshot_type=changed` 时必须写 `previous_snapshot` 或在正文说明变化依据。 - `skills` 使用 [skill-taxonomy](skill-taxonomy.md) 中的标签,新增标签要同步补充说明。 - `Raw JD Summary` 只做摘要和结构化提取,避免长篇搬运。 - `Extracted Signals` 是最重要部分:它把 JD 从资料变成判断。 diff --git a/jobs/source-registry.md b/jobs/source-registry.md index 9766db5..16f0a20 100644 --- a/jobs/source-registry.md +++ b/jobs/source-registry.md @@ -2,6 +2,8 @@ 这个文件记录 JD 收集来源、优先级和搜索策略。 +默认收集窗口是滚动最近 6 个月。每次收集要尽量保留岗位快照,用于观察需求变化。 + ## Source Priority | Priority | Source Type | Use | @@ -54,7 +56,8 @@ DeepSeek 大模型 应用 工程师 北京 ## Collection Cadence -- weekly: 新增岗位和明显变化 +- initial backfill: 补齐最近 6 个月范围内的目标公司岗位 +- weekly: 检查窗口内新增岗位、下线岗位和描述变化 - monthly: 高频技能、公司差异和知识缺口汇总 - quarterly: 判断哪些能力已经从加分项变成基础要求 @@ -62,10 +65,10 @@ DeepSeek 大模型 应用 工程师 北京 当你让我收集 JD 时,我会: -1. 先确认范围:城市、公司、关键词、时间窗口。 +1. 默认使用最近 6 个月窗口;必要时再确认城市、公司和关键词。 2. 优先查官方来源,再补充招聘平台和社区线索。 3. 为每条岗位创建 `jobs/items/` 笔记。 -4. 抽取技能、业务方向、隐含能力和知识缺口。 +4. 抽取技能、业务方向、隐含能力、知识缺口和需求变化。 5. 更新 [market-insights](market-insights.md) 和 [skill-taxonomy](skill-taxonomy.md)。 6. 标记需要补论文、实验或项目验证的方向。 @@ -74,3 +77,4 @@ DeepSeek 大模型 应用 工程师 北京 - 一些招聘平台需要登录、验证码或限制搜索结果。 - 同一岗位可能在多个渠道重复出现,需要按公司、岗位、来源和日期去重。 - JD 过期很快,所有判断都必须带日期。 +- 部分官网不保留历史 JD,必要时用招聘平台、搜索缓存或用户提供的快照补充。 diff --git a/papers/README.md b/papers/README.md index e8260a4..a95766c 100644 --- a/papers/README.md +++ b/papers/README.md @@ -4,6 +4,8 @@ 不按单一主题目录存放论文。每篇论文统一放在 `items/`,通过 metadata 支持多标签、多视图和后续前端索引。 +论文收集先确认来源,再做系统性整理。来源状态维护在 [source-registry](source-registry.md)。 + ## Structure - [items](items/README.md): 每篇论文一个 Markdown 文件 diff --git a/papers/source-registry.md b/papers/source-registry.md index 3be4f06..3a24395 100644 --- a/papers/source-registry.md +++ b/papers/source-registry.md @@ -2,6 +2,20 @@ 这个文件记录论文收集来源、搜索策略和筛选规则。 +论文来源需要先确认。系统性收集只使用 `approved` 来源;`candidate` 来源可以提出但不进入稳定收集流程。 + +## Source Approval + +| Source | Status | Notes | +| --- | --- | --- | +| arXiv | candidate | 新论文发现和预印本 | +| OpenReview | candidate | ICLR、NeurIPS 等投稿和评审线索 | +| ACL Anthology | candidate | NLP、RAG、tool use、evaluation 相关论文 | +| Conference proceedings | candidate | NeurIPS、ICLR、ICML、ACL、EMNLP、KDD、WWW 等 | +| Papers with Code | candidate | benchmark、代码和任务关联 | +| Official project GitHub | candidate | 复现代码、模型卡和实验配置 | +| Company research blogs | candidate | 只收技术细节足够强的研究内容 | + ## Source Types | Source | Use | @@ -73,8 +87,8 @@ SWE-bench agent repair repository 当你让我收集论文时,我会: -1. 先确认范围:主题、年份、会议、是否需要最新论文。 -2. 在线检索并优先选择原始论文页、会议页、代码仓库。 +1. 先确认来源集合是否已经 approved,再确认主题、年份、会议、是否需要最新论文。 +2. 在线检索并优先选择 approved 来源中的原始论文页、会议页、代码仓库。 3. 去重并放入 [reading-queue](reading-queue.md)。 4. 为高优先级论文创建 `papers/items/` 笔记。 5. 提取方法、证据、限制、可复现实验和项目启发。 diff --git a/references/README.md b/references/README.md index 16d969a..5c06ebd 100644 --- a/references/README.md +++ b/references/README.md @@ -3,6 +3,7 @@ 这里收集文章、开源项目、课程、产品文档和案例。 论文已经提升为独立目录,放在 [Papers](../papers/README.md)。 +大公司 Agent 工作、技术报告和工程博客已经提升为独立目录,放在 [Industry](../industry/README.md)。 ## Reference Index diff --git a/templates/README.md b/templates/README.md index 06dc8cc..b073cb0 100644 --- a/templates/README.md +++ b/templates/README.md @@ -6,6 +6,7 @@ | --- | --- | | [concept-note](concept-note.md) | 新概念、新术语、新模式 | | [jd-note](jd-note.md) | 北京大厂 Agent / LLM 岗位记录 | +| [industry-note](industry-note.md) | 大公司 Agent 工作、技术报告和工程博客 | | [project-brief](project-brief.md) | Agent 项目、原型、工程组件 | | [experiment-note](experiment-note.md) | 假设验证、模型对比、策略实验 | | [paper-note](paper-note.md) | 论文和研究资料 | diff --git a/templates/industry-note.md b/templates/industry-note.md new file mode 100644 index 0000000..2fc2a02 --- /dev/null +++ b/templates/industry-note.md @@ -0,0 +1,89 @@ +# Industry: <company> - <title> + +--- +type: industry +company: +team: +title: +url: +source_name: +source_type: technical-report / research-blog / engineering-blog / product-blog / product-doc / code-release / benchmark / talk / other +source_quality: official / official-adjacent / secondary / unknown +published_at: +collected_at: YYYY-MM-DD +status: queued / summarized / analyzed / deprecated +topics: + - +implementation_signals: + - +product_area: + - +models: + - +tools: + - +benchmarks: + - +related_papers: + - +related_jobs: + - +related_experiments: + - +related_projects: + - +evidence_level: high / medium / low +relevance: high / medium / low +--- + +## One-line Takeaway + +一句话说明这条资料暴露了什么行业趋势或工程经验。 + +## Source Snapshot + +- source: +- published_at: +- collected_at: +- source_quality: + +## What They Built or Claimed + +- + +## Technical Signals + +- architecture: +- tool use: +- memory: +- evaluation: +- safety: +- deployment: +- data: + +## Product and Business Signals + +- users: +- scenario: +- pricing / availability: +- go-to-market: + +## Evidence Quality + +- + +## Links + +- papers: +- jobs: +- experiments: +- projects: +- docs: + +## Gaps for Us + +- + +## Notes + +- diff --git a/templates/jd-note.md b/templates/jd-note.md index aedfe8e..84fe2dc 100644 --- a/templates/jd-note.md +++ b/templates/jd-note.md @@ -10,6 +10,11 @@ source_name: source_quality: official / job-board / social / secondary / unknown collected_at: YYYY-MM-DD posted_at: +first_seen_at: +last_checked_at: +snapshot_type: new / changed / unchanged / expired +job_code: +previous_snapshot: status: active / expired / unknown level: team: @@ -37,6 +42,14 @@ relevance: high / medium / low - collected_at: - availability: +## Change Snapshot + +- first_seen_at: +- last_checked_at: +- snapshot_type: +- previous_snapshot: +- changed_fields: + ## Raw JD Summary 用自己的话概括岗位职责、任职要求和加分项。