Add industry collection and six-month job tracking

This commit is contained in:
wuyang
2026-07-08 11:25:52 +08:00
parent 1b6cc1f59a
commit 36c2499d3c
19 changed files with 550 additions and 23 deletions
+4 -2
View File
@@ -11,10 +11,11 @@
- [Architecture Patterns](docs/02-architecture-patterns.md): 常见 Agent 架构与选型判断
- [Practice Playbook](docs/03-practice-playbook.md): 从需求到上线的实践清单
- [Evaluation and Observability](docs/04-evaluation-observability.md): 评估体系、指标、日志和回归
- [Collection Workflow](docs/05-collection-workflow.md): JD 和论文的持续收集流程
- [Collection Workflow](docs/05-collection-workflow.md): JD、论文和行业实践的持续收集流程
- [Glossary](docs/99-glossary.md): 统一术语表
- [Jobs](jobs/README.md): 北京大厂 Agent / LLM 相关岗位要求
- [Papers](papers/README.md): Agent 相关论文、阅读队列和研究洞察
- [Industry](industry/README.md): 大公司 Agent 工作、技术报告和工程博客
- [Projects](projects/README.md): 项目目录、项目记录和复盘
- [Experiments](experiments/README.md): 实验台账、假设、结果和决策
- [References](references/README.md): 文章、开源项目、课程和产品文档
@@ -36,7 +37,8 @@
3. 验证一个想法:用 [experiment-note](templates/experiment-note.md) 记录假设和结果。
4. 收集一条岗位:用 [jd-note](templates/jd-note.md) 提取岗位要求和能力信号。
5. 读一篇论文:用 [paper-note](templates/paper-note.md) 提炼可迁移结论。
6. 有稳定结论后,把它合并到 `docs/` 的对应主题页
6. 看到大公司 Agent 实践:用 [industry-note](templates/industry-note.md) 提取技术和产品信号
7. 有稳定结论后,把它合并到 `docs/` 的对应主题页。
## Status Labels
+2
View File
@@ -14,6 +14,7 @@ Agent 知识可以按“问题层级”整理,而不是按资料来源堆放
| 评估 | 怎么判断 Agent 是否可靠 | 测试集、指标、观测和回归 |
| 岗位 | 市场正在要求什么 Agent 能力 | JD 笔记、技能趋势、能力缺口 |
| 论文 | 研究里哪些方法和证据值得吸收 | 阅读队列、论文笔记、研究洞察 |
| 行业 | 大公司正在怎么落地 Agent | 技术报告、工程博客、产品实践、公司趋势 |
| 资料 | 外部知识如何沉淀为判断 | 文章摘要、项目阅读、课程和文档笔记 |
## Taxonomy
@@ -60,6 +61,7 @@ Agent 知识可以按“问题层级”整理,而不是按资料来源堆放
- `incident`: 来自失败案例或线上问题
- `job`: 来自岗位要求和市场信号
- `paper`: 来自研究论文和 benchmark
- `industry`: 来自大公司技术报告、工程博客、产品发布和代码仓库
## Maturity Model
+73 -15
View File
@@ -1,6 +1,6 @@
# Collection Workflow
这个文档定义我如何帮你持续收集 JD 和论文
这个文档定义我如何帮你持续收集 JD、论文和大公司 Agent 实践资料
核心原则:先让资料稳定进入知识库,再逐步自动化;不要一开始为了自动化牺牲判断质量。
@@ -10,7 +10,7 @@
你给我链接、截图、岗位描述、论文标题或 PDF,我负责:
- 判断它应该进入 `jobs/``papers/` 还是 `references/`
- 判断它应该进入 `jobs/``papers/``industry/` 还是 `references/`
- 提取结构化 metadata。
- 建立 Markdown 笔记。
- 打标签和关联已有知识。
@@ -21,6 +21,7 @@
- 你平时看到的单条 JD。
- 朋友转来的内推信息。
- 某篇你觉得重要的论文。
- 大公司发布的 Agent 技术报告、工程博客、产品文档或代码仓库。
- 临时想整理的一批资料。
### 2. Live Web Sweep
@@ -30,10 +31,11 @@
例子:
```text
收集最近北京大厂 Agent 岗位
收集最近 6 个月北京大厂 Agent 岗位
找最近三个月 Agent evaluation 相关论文
整理 DeepSeek 和腾讯的大模型应用岗位要求
找 coding agent 方向值得读的 10 篇论文
整理 OpenAI、Anthropic、Google DeepMind 最近的 Agent 技术报告和博客
```
我会做:
@@ -42,8 +44,8 @@
2. 在线检索:优先官方来源,其次可信平台和社区线索。
3. 去重:按标题、公司、岗位、URL、日期或论文 DOI/arXiv ID 去重。
4. 记录来源:每条资料都保留 `source_url``collected_at`
5. 结构化:生成 `jobs/items/``papers/items/` 笔记。
6. 提炼判断:更新 `market-insights.md``paper-insights.md`
5. 结构化:生成 `jobs/items/``papers/items/``industry/items/` 笔记。
6. 提炼判断:更新 `market-insights.md``paper-insights.md``industry-insights.md`
7. 回流知识:标记需要更新的 `docs/``experiments/``projects/`
### 3. Batch Import
@@ -54,6 +56,7 @@
- 招聘网站搜索结果。
- arXiv 搜索结果。
- 公司博客和技术报告链接合集。
- 论文清单。
- 朋友发来的岗位合集。
@@ -69,7 +72,8 @@
- 生成搜索、筛选、时间线和标签页。
- 定期检查 JD 是否过期。
- 定期拉取论文搜索结果。
- 把 JD 技能和论文 topic 做关联图谱
- 定期检查大公司 Agent 技术博客、报告和代码发布
- 把 JD 技能、论文 topic 和行业实践做关联图谱。
## JD Collection
@@ -77,10 +81,13 @@
默认范围:
- time window: 滚动最近 6 个月,优先全量收集范围内岗位
- location: 北京
- companies: DeepSeek、腾讯、字节、阿里、百度、美团、快手、京东、小米、智谱、月之暗面
- keywords: Agent、大模型、LLM、RAG、智能体、模型评估、AI Infra、代码智能、AI 产品
JD 收集的主要目标是观察需求变化,而不是只抓最新岗位。每轮收集都要尽量保留快照,后续用同公司、同岗位、同能力标签的变化来判断趋势。
### Source Priority
1. 公司官方招聘站和官方发布。
@@ -95,6 +102,7 @@
- raw items: `jobs/items/*.md`
- trend update: `jobs/market-insights.md`
- taxonomy update: `jobs/skill-taxonomy.md`
- change notes: 同类岗位在最近 6 个月内的技能、职责、级别和业务方向变化
### JD Extraction Focus
@@ -111,7 +119,7 @@
### Example Prompt
```text
收集本周北京 DeepSeek、腾讯、字节的 Agent / LLM 应用岗位,优先官方来源,每家公司至少 3 条,如果官方不足再补招聘平台。
收集最近 6 个月北京 DeepSeek、腾讯、字节的 Agent / LLM 应用岗位,优先官方来源如果官方不足再补招聘平台和社区线索,重点分析要求变化
```
## Paper Collection
@@ -130,7 +138,11 @@
- Human-in-the-loop
- Computer use
### Source Priority
### Source Policy
论文来源需要先确认,再进入持续收集。默认我会先提出候选来源清单,由你确认为 `approved` 后再做系统性 sweep。
### Candidate Source Priority
1. 论文原始页面、arXiv、OpenReview、ACL Anthology。
2. 会议 proceedings。
@@ -163,14 +175,55 @@
找最近 6 个月 Agent evaluation 方向最值得读的论文,优先有 benchmark 或代码的,整理成 reading queue。
```
## Industry Collection
### Scope
默认收集大公司和重要 AI 团队的 Agent 工作:
- frontier labs: OpenAI、Anthropic、Google DeepMind、Microsoft、Meta、Amazon、NVIDIA
- China AI teams: DeepSeek、腾讯、字节 Seed、阿里 Qwen、百度、智谱、月之暗面
- material types: 技术报告、研究博客、工程博客、产品文档、代码仓库、benchmark、开发者大会材料
### Source Priority
1. 官方技术报告、官方研究页、官方工程博客、官方产品文档。
2. 官方 GitHub、Hugging Face、模型卡和 benchmark 页面。
3. 官方演讲、开发者大会、发布会文字稿。
4. 可信第三方深度分析,只作为线索或补充。
### Output
每轮行业资料收集输出三类东西:
- raw items: `industry/items/*.md`
- trend update: `industry/industry-insights.md`
- watchlist update: `industry/company-watchlist.md`
### Industry Extraction Focus
我会重点抽取:
- 公司正在把 Agent 用在哪些产品场景。
- 公开的架构、工具使用、记忆、评估、安全和部署信号。
- 是否有技术报告、代码、benchmark 或只是产品宣传。
- 和论文、JD、实验、项目之间的相互印证。
- 对我们知识库和项目规划的启发。
### Example Prompt
```text
收集最近 6 个月 OpenAI、Anthropic、Google DeepMind、Microsoft 的 Agent 技术报告和工程博客,按证据强度排序。
```
## Cross-linking
JD 和论文必须互相打通。
JD、论文和行业实践必须互相打通。
一个技能或概念最好能形成这样的链路:
```text
Job requirement -> Paper evidence -> Experiment validation -> Project practice -> Docs conclusion
Job requirement -> Paper evidence -> Industry practice -> Experiment validation -> Project practice -> Docs conclusion
```
例子:
@@ -179,6 +232,7 @@ Job requirement -> Paper evidence -> Experiment validation -> Project practice -
agent-evaluation
jobs: 哪些公司要求模型评估、Agent benchmark、线上观测
papers: 哪些论文定义评估方法和 benchmark
industry: 哪些公司公开了 Agent 评估、观测或安全实践
experiments: 我们能否复现实验或搭一个 eval harness
projects: 哪些项目需要这套评估能力
docs: 稳定结论沉淀到 Evaluation and Observability
@@ -193,16 +247,17 @@ agent-evaluation
- 不确定的内容标记为 `unknown``needs verification`
- 过期 JD 不删除,改状态并保留原因。
- 论文没有读完时只进入 queue,不伪装成已总结。
- 行业资料要区分技术证据和产品宣传。
## Review Rhythm
建议先用轻量节奏:
| Rhythm | JD | Papers |
| --- | --- | --- |
| Weekly | 新增岗位、明显变化 | 新论文线索、阅读队列 |
| Monthly | 市场技能趋势 | 主题研究洞察 |
| Quarterly | 能力缺口和学习路线 | 成熟结论回流 `docs/` |
| Rhythm | JD | Papers | Industry |
| --- | --- | --- | --- |
| Weekly | 最近 6 个月窗口内新增和变化 | 新论文线索、阅读队列 | 大公司新发布和技术报告 |
| Monthly | 市场技能趋势和需求变化 | 主题研究洞察 | 公司实践趋势 |
| Quarterly | 能力缺口和学习路线 | 成熟结论回流 `docs/` | 行业实践和项目规划复盘 |
## What I Need From You
@@ -212,5 +267,8 @@ agent-evaluation
- 是否只看北京。
- 是否看实习、校招、社招。
- 岗位偏工程、研究、产品还是综合。
- JD 是否只收北京,或是否包含远程/杭州/深圳等强相关岗位。
- 论文来源名单是否已经确认。
- 论文偏最新趋势、经典必读,还是能直接指导项目实现。
- 行业资料优先看哪些公司和哪些产品方向。
- 每轮希望收集多少条。
+35
View File
@@ -0,0 +1,35 @@
# Industry
这里持续收集大公司和重要 AI 团队的 Agent 相关工作:产品发布、技术报告、研究博客、工程博客、代码仓库、benchmark 和实践复盘。
它和 `papers/` 的区别:`papers/` 关注研究证据,`industry/` 关注公司真实在做什么、怎么落地、暴露了哪些工程和产品趋势。
## Structure
- [items](items/README.md): 每条公司工作一个 Markdown 文件
- [schema](schema.md): 行业资料字段和写法
- [source-registry](source-registry.md): 官方来源和可信来源清单
- [company-watchlist](company-watchlist.md): 重点公司和团队
- [industry-insights](industry-insights.md): 周期性趋势总结
## Collection Questions
- 大公司正在把 Agent 用在哪些产品和场景?
- 它们公开了哪些系统设计、工具调用、记忆、评估、安全和部署经验?
- 哪些工作只是产品宣传,哪些有技术细节或可复现材料?
- 哪些行业实践能反哺我们的项目、实验和知识文档?
- 公司实践和 JD 要求、论文趋势之间是否互相印证?
## Workflow
1. 收集官方博客、技术报告、产品文档、代码仓库或演讲资料。
2. 用 [industry-note](../templates/industry-note.md) 建立结构化笔记。
3. 标注 company、source_type、topics、implementation_signals 和 evidence_level。
4. 更新 [industry-insights](industry-insights.md)。
5. 把稳定结论回流到 `docs/``papers/``jobs/``experiments/``projects/`
## Initial Scope
- frontier labs: OpenAI、Anthropic、Google DeepMind、Microsoft、Meta、Amazon、NVIDIA
- China AI teams: DeepSeek、腾讯、字节 Seed、阿里 Qwen、百度、智谱、月之暗面
- product areas: coding agent、computer use、deep research、office agent、enterprise agent、agent safety、multi-agent、agent evaluation
+31
View File
@@ -0,0 +1,31 @@
# Company Watchlist
## Frontier Labs
| Company | Focus | Priority |
| --- | --- | --- |
| OpenAI | Codex、computer use、deep research、agent productization、evaluation | P0 |
| Anthropic | Claude Code、computer use、tool use、安全、enterprise agent | P0 |
| Google DeepMind | Gemini agent、multi-agent safety、agent security、research reports | P0 |
| Microsoft | Copilot、Agent AI、software engineering agents、enterprise agent ecosystem | P0 |
| Meta | Llama、open models、agent frameworks、consumer AI | P1 |
| Amazon | Alexa、AWS agent services、industrial AI applications | P1 |
| NVIDIA | Agent systems、inference、robotics、accelerated deployment | P1 |
## China AI Teams
| Company / Team | Focus | Priority |
| --- | --- | --- |
| DeepSeek | reasoning、coding、open models、agent capabilities、infra | P0 |
| 字节 Seed | Doubao、Seed models、agent era、world models、AI infra | P0 |
| 阿里 Qwen | Qwen Agent、coding、multimodal agents、open models | P0 |
| 腾讯 | 混元、元宝、企业应用、游戏和内容场景、AI Lab | P0 |
| 百度 | 文心、搜索、智能云、Agent 应用 | P1 |
| 智谱 | GLM、Agent 平台、企业应用 | P1 |
| 月之暗面 | Kimi、长上下文、AI 助手 | P1 |
## Review Rules
- P0 每周扫一轮重大更新。
- P1 每月扫一轮,除非出现明显热点。
- 新公司先进入候选,连续出现高价值 Agent 信息后再提升优先级。
+53
View File
@@ -0,0 +1,53 @@
# Industry Insights
status: seed
这个文件沉淀大公司 Agent 工作和技术报告的趋势判断。单条资料放在 `industry/items/`,这里记录跨公司的归纳。
## Current Snapshot
- date:
- scope:
- sources reviewed:
## Strong Industry Signals
-
## Weak or Marketing-heavy Signals
-
## Company Patterns
| Company | Agent Direction | Evidence | Notes |
| --- | --- | --- | --- |
| OpenAI | _TBD_ | _TBD_ | _TBD_ |
| Anthropic | _TBD_ | _TBD_ | _TBD_ |
| Google DeepMind | _TBD_ | _TBD_ | _TBD_ |
| Microsoft | _TBD_ | _TBD_ | _TBD_ |
| DeepSeek | _TBD_ | _TBD_ | _TBD_ |
| 腾讯 | _TBD_ | _TBD_ | _TBD_ |
| 字节 Seed | _TBD_ | _TBD_ | _TBD_ |
| 阿里 Qwen | _TBD_ | _TBD_ | _TBD_ |
## Implementation Patterns
- tool use:
- memory:
- evaluation:
- safety:
- deployment:
- productization:
## Follow-up Queue
-
## Links Back to Knowledge Base
- docs to update:
- papers to read:
- jobs to compare:
- experiments to create:
- projects affected:
+17
View File
@@ -0,0 +1,17 @@
# Industry Items
每条公司工作一个文件,文件名建议:
```text
YYYY-MM-DD-company-short-title.md
```
例子:
```text
2026-07-08-openai-agents-transforming-work.md
2026-07-08-google-deepmind-agent-security.md
2026-07-08-qwen-agentworld.md
```
如果同一公司连续发布多个相关材料,优先拆成多条 item,再在 `industry-insights.md` 中做汇总。不要把多个来源混成一条笔记,否则后续很难追踪证据。
+105
View File
@@ -0,0 +1,105 @@
# Industry Schema
行业资料笔记使用 YAML frontmatter 加正文。
## Frontmatter
```yaml
---
type: industry
company:
team:
title:
url:
source_name:
source_type: technical-report / research-blog / engineering-blog / product-blog / product-doc / code-release / benchmark / talk / other
source_quality: official / official-adjacent / secondary / unknown
published_at:
collected_at: YYYY-MM-DD
status: queued / summarized / analyzed / deprecated
topics:
- agent
implementation_signals:
- tool-use
product_area:
- coding-agent
models:
-
tools:
-
benchmarks:
-
related_papers:
-
related_jobs:
-
related_experiments:
-
related_projects:
-
evidence_level: high / medium / low
relevance: high / medium / low
---
```
## Body
```text
# <company> - <title>
## One-line Takeaway
一句话说明这条资料暴露了什么行业趋势或工程经验。
## Source Snapshot
来源、发布日期、采集日期、来源质量。
## What They Built or Claimed
公司发布了什么产品、系统、能力、报告或代码?
## Technical Signals
- architecture:
- tool use:
- memory:
- evaluation:
- safety:
- deployment:
- data:
## Product and Business Signals
- users:
- scenario:
- pricing / availability:
- go-to-market:
## Evidence Quality
判断它是强证据还是弱信号。是否有论文、技术报告、benchmark、代码或只是营销描述?
## Links
- papers:
- jobs:
- experiments:
- projects:
- docs:
## Gaps for Us
-
## Notes
-
```
## Field Rules
- `url``collected_at` 必填。
- 优先官方来源;二手来源只能作为线索。
- `evidence_level``source_quality` 必须分开:官方产品博客也可能证据很弱。
- 技术细节不足时标记为 `low`,不要强行推断实现。
+67
View File
@@ -0,0 +1,67 @@
# Industry Source Registry
这个文件记录大公司 Agent 工作、技术报告和工程博客的来源。
## Source Priority
| Priority | Source Type | Use |
| --- | --- | --- |
| 1 | 官方研究页、官方博客、官方技术报告、官方文档 | 直接整理 |
| 2 | 官方 GitHub、Hugging Face、模型卡、benchmark 页面 | 直接整理,但注意版本 |
| 3 | 官方会议演讲、开发者大会、产品发布页 | 可整理,标注产品宣传成分 |
| 4 | 可信媒体访谈、第三方深度分析 | 作为线索或补充,不单独形成强结论 |
## Candidate Official Sources
这些来源可作为第一批候选。后续每次收集前可以按主题取子集。
| Company / Team | Source | URL | Notes |
| --- | --- | --- | --- |
| OpenAI | Research | https://openai.com/research/ | 研究论文、系统报告、agent 相关研究 |
| OpenAI | News / Index | https://openai.com/index/ | 产品、经济研究、发布博客 |
| Anthropic | Research | https://www.anthropic.com/research | 研究报告和安全材料 |
| Anthropic | News | https://www.anthropic.com/news | 产品发布、computer use、Claude 相关工作 |
| Google DeepMind | Blog | https://deepmind.google/blog/ | agent、安全、多 Agent、Gemini 相关博客 |
| Google DeepMind | Publications | https://deepmind.google/research/publications/ | 论文和技术报告索引 |
| Google Research | Blog | https://research.google/blog/ | 研究博客和系统实践 |
| Microsoft Research | Blog | https://www.microsoft.com/en-us/research/blog/ | Agent、安全、软件工程和研究博客 |
| Microsoft Research | Agent AI project | https://www.microsoft.com/en-us/research/project/agent-ai/ | Agent 项目页 |
| Meta AI | Blog | https://ai.meta.com/blog/ | Llama、agents、产品和研究发布 |
| Amazon Science | Home | https://www.amazon.science/ | 工业研究和应用论文 |
| NVIDIA Research | Home | https://research.nvidia.com/ | Agent、模型、系统研究 |
| NVIDIA Technical Blog | Blog | https://developer.nvidia.com/blog/ | 工程博客、部署和加速实践 |
| DeepSeek | Home / News | https://www.deepseek.com/ | 官方入口和岗位入口 |
| DeepSeek | GitHub | https://github.com/deepseek-ai | 模型、报告和代码发布 |
| ByteDance Seed | Home | https://seed.bytedance.com/en/ | Seed 团队入口 |
| ByteDance Seed | Research | https://seed.bytedance.com/en/research | 研究和技术发布 |
| ByteDance Seed | GitHub | https://github.com/ByteDance-Seed | 代码和项目发布 |
| Qwen | Blog | https://qwen.ai/blog | Qwen 模型、Agent 和技术博客 |
| Qwen | Hugging Face | https://huggingface.co/Qwen | 模型卡、发布和代码入口 |
| Alibaba Cloud | Blog | https://www.alibabacloud.com/blog | 阿里云工程博客和产品实践 |
| Tencent AI Lab | Home | https://ai.tencent.com/ailab/ | 腾讯 AI Lab 研究入口 |
| Baidu Research | Home | https://research.baidu.com/ | 百度研究入口 |
## Collection Queries
```text
site:openai.com/index agent technical report
site:anthropic.com/news computer use agent
site:deepmind.google/blog agent safety multi-agent
site:microsoft.com/en-us/research/blog agent evaluation
site:qwen.ai/blog agent coding
site:seed.bytedance.com/en agent LLM
site:github.com/deepseek-ai agent
site:ai.tencent.com/ailab agent large language model
```
## Collection Cadence
- weekly: 新发布、重大产品或技术报告
- monthly: 公司实践趋势和技术信号
- quarterly: 行业实践和论文/JD/项目之间的交叉分析
## Quality Notes
- 产品博客通常能说明方向,但不一定能说明实现。
- 技术报告、代码和 benchmark 的证据强度更高。
- 公司公开信息天然带宣传倾向,需要和论文、代码、实际产品体验或 JD 互相校验。
+10
View File
@@ -30,6 +30,16 @@
## Initial Scope
- time window: 滚动最近 6 个月,优先全量收集范围内岗位
- location: 北京优先
- companies: DeepSeek、腾讯、字节、阿里、百度、美团、快手、京东、小米、商汤、智谱、月之暗面等
- role keywords: Agent、LLM、AIGC、大模型应用、RAG、AI Infra、模型评估、智能体、代码智能、AI 产品
## Primary Goal
JD 收集的主要目标是观察岗位需求变化:
- 同一公司是否从研究转向产品落地。
- 同一岗位是否开始要求评估、数据飞轮、Agent 工程化或部署能力。
- Agent 相关词汇是否从加分项变成硬性要求。
- 北京岗位和其他城市岗位是否体现不同团队布局。
+7 -1
View File
@@ -7,10 +7,16 @@ status: seed
## Current Snapshot
- date:
- scope: 北京,大厂 Agent / LLM 相关岗位
- scope: 北京,大厂 Agent / LLM 相关岗位,滚动最近 6 个月
- sample size:
- source mix:
## Requirement Changes
| Period | Signal | Companies | Evidence | Notes |
| --- | --- | --- | --- | --- |
| _TBD_ | _TBD_ | _TBD_ | _TBD_ | _TBD_ |
## High-frequency Skills
| Skill | Count | Companies | Notes |
+17
View File
@@ -15,6 +15,11 @@ source_name:
source_quality: official / job-board / social / secondary / unknown
collected_at: YYYY-MM-DD
posted_at:
first_seen_at:
last_checked_at:
snapshot_type: new / changed / unchanged / expired
job_code:
previous_snapshot:
status: active / expired / unknown
level:
team:
@@ -48,6 +53,16 @@ relevance: high / medium / low
来源、采集日期、是否北京岗位、是否仍可访问。
## Change Snapshot
用于记录最近 6 个月窗口内的变化:
- first_seen_at:
- last_checked_at:
- snapshot_type:
- previous_snapshot:
- changed_fields:
## Raw JD Summary
用自己的话概括岗位职责、任职要求和加分项。不要无选择地复制长段原文。
@@ -91,6 +106,8 @@ relevance: high / medium / low
- `source_url` 必填,除非来源是用户直接提供的截图或文本。
- `collected_at` 必填,因为 JD 是强时效资料。
- `first_seen_at``last_checked_at` 用于追踪近 6 个月需求变化。
- `snapshot_type=changed` 时必须写 `previous_snapshot` 或在正文说明变化依据。
- `skills` 使用 [skill-taxonomy](skill-taxonomy.md) 中的标签,新增标签要同步补充说明。
- `Raw JD Summary` 只做摘要和结构化提取,避免长篇搬运。
- `Extracted Signals` 是最重要部分:它把 JD 从资料变成判断。
+7 -3
View File
@@ -2,6 +2,8 @@
这个文件记录 JD 收集来源、优先级和搜索策略。
默认收集窗口是滚动最近 6 个月。每次收集要尽量保留岗位快照,用于观察需求变化。
## Source Priority
| Priority | Source Type | Use |
@@ -54,7 +56,8 @@ DeepSeek 大模型 应用 工程师 北京
## Collection Cadence
- weekly: 新增岗位和明显变化
- initial backfill: 补齐最近 6 个月范围内的目标公司岗位
- weekly: 检查窗口内新增岗位、下线岗位和描述变化
- monthly: 高频技能、公司差异和知识缺口汇总
- quarterly: 判断哪些能力已经从加分项变成基础要求
@@ -62,10 +65,10 @@ DeepSeek 大模型 应用 工程师 北京
当你让我收集 JD 时,我会:
1. 先确认范围:城市、公司关键词、时间窗口
1. 默认使用最近 6 个月窗口;必要时再确认城市、公司关键词。
2. 优先查官方来源,再补充招聘平台和社区线索。
3. 为每条岗位创建 `jobs/items/` 笔记。
4. 抽取技能、业务方向、隐含能力知识缺口。
4. 抽取技能、业务方向、隐含能力知识缺口和需求变化
5. 更新 [market-insights](market-insights.md) 和 [skill-taxonomy](skill-taxonomy.md)。
6. 标记需要补论文、实验或项目验证的方向。
@@ -74,3 +77,4 @@ DeepSeek 大模型 应用 工程师 北京
- 一些招聘平台需要登录、验证码或限制搜索结果。
- 同一岗位可能在多个渠道重复出现,需要按公司、岗位、来源和日期去重。
- JD 过期很快,所有判断都必须带日期。
- 部分官网不保留历史 JD,必要时用招聘平台、搜索缓存或用户提供的快照补充。
+2
View File
@@ -4,6 +4,8 @@
不按单一主题目录存放论文。每篇论文统一放在 `items/`,通过 metadata 支持多标签、多视图和后续前端索引。
论文收集先确认来源,再做系统性整理。来源状态维护在 [source-registry](source-registry.md)。
## Structure
- [items](items/README.md): 每篇论文一个 Markdown 文件
+16 -2
View File
@@ -2,6 +2,20 @@
这个文件记录论文收集来源、搜索策略和筛选规则。
论文来源需要先确认。系统性收集只使用 `approved` 来源;`candidate` 来源可以提出但不进入稳定收集流程。
## Source Approval
| Source | Status | Notes |
| --- | --- | --- |
| arXiv | candidate | 新论文发现和预印本 |
| OpenReview | candidate | ICLR、NeurIPS 等投稿和评审线索 |
| ACL Anthology | candidate | NLP、RAG、tool use、evaluation 相关论文 |
| Conference proceedings | candidate | NeurIPS、ICLR、ICML、ACL、EMNLP、KDD、WWW 等 |
| Papers with Code | candidate | benchmark、代码和任务关联 |
| Official project GitHub | candidate | 复现代码、模型卡和实验配置 |
| Company research blogs | candidate | 只收技术细节足够强的研究内容 |
## Source Types
| Source | Use |
@@ -73,8 +87,8 @@ SWE-bench agent repair repository
当你让我收集论文时,我会:
1. 先确认范围:主题、年份、会议、是否需要最新论文。
2. 在线检索并优先选择原始论文页、会议页、代码仓库。
1. 先确认来源集合是否已经 approved,再确认主题、年份、会议、是否需要最新论文。
2. 在线检索并优先选择 approved 来源中的原始论文页、会议页、代码仓库。
3. 去重并放入 [reading-queue](reading-queue.md)。
4. 为高优先级论文创建 `papers/items/` 笔记。
5. 提取方法、证据、限制、可复现实验和项目启发。
+1
View File
@@ -3,6 +3,7 @@
这里收集文章、开源项目、课程、产品文档和案例。
论文已经提升为独立目录,放在 [Papers](../papers/README.md)。
大公司 Agent 工作、技术报告和工程博客已经提升为独立目录,放在 [Industry](../industry/README.md)。
## Reference Index
+1
View File
@@ -6,6 +6,7 @@
| --- | --- |
| [concept-note](concept-note.md) | 新概念、新术语、新模式 |
| [jd-note](jd-note.md) | 北京大厂 Agent / LLM 岗位记录 |
| [industry-note](industry-note.md) | 大公司 Agent 工作、技术报告和工程博客 |
| [project-brief](project-brief.md) | Agent 项目、原型、工程组件 |
| [experiment-note](experiment-note.md) | 假设验证、模型对比、策略实验 |
| [paper-note](paper-note.md) | 论文和研究资料 |
+89
View File
@@ -0,0 +1,89 @@
# Industry: <company> - <title>
---
type: industry
company:
team:
title:
url:
source_name:
source_type: technical-report / research-blog / engineering-blog / product-blog / product-doc / code-release / benchmark / talk / other
source_quality: official / official-adjacent / secondary / unknown
published_at:
collected_at: YYYY-MM-DD
status: queued / summarized / analyzed / deprecated
topics:
-
implementation_signals:
-
product_area:
-
models:
-
tools:
-
benchmarks:
-
related_papers:
-
related_jobs:
-
related_experiments:
-
related_projects:
-
evidence_level: high / medium / low
relevance: high / medium / low
---
## One-line Takeaway
一句话说明这条资料暴露了什么行业趋势或工程经验。
## Source Snapshot
- source:
- published_at:
- collected_at:
- source_quality:
## What They Built or Claimed
-
## Technical Signals
- architecture:
- tool use:
- memory:
- evaluation:
- safety:
- deployment:
- data:
## Product and Business Signals
- users:
- scenario:
- pricing / availability:
- go-to-market:
## Evidence Quality
-
## Links
- papers:
- jobs:
- experiments:
- projects:
- docs:
## Gaps for Us
-
## Notes
-
+13
View File
@@ -10,6 +10,11 @@ source_name:
source_quality: official / job-board / social / secondary / unknown
collected_at: YYYY-MM-DD
posted_at:
first_seen_at:
last_checked_at:
snapshot_type: new / changed / unchanged / expired
job_code:
previous_snapshot:
status: active / expired / unknown
level:
team:
@@ -37,6 +42,14 @@ relevance: high / medium / low
- collected_at:
- availability:
## Change Snapshot
- first_seen_at:
- last_checked_at:
- snapshot_type:
- previous_snapshot:
- changed_fields:
## Raw JD Summary
用自己的话概括岗位职责、任职要求和加分项。