# Collection Workflow 这个文档定义我如何帮你持续收集 JD 和论文。 核心原则:先让资料稳定进入知识库,再逐步自动化;不要一开始为了自动化牺牲判断质量。 ## Collection Modes ### 1. User-provided Source 你给我链接、截图、岗位描述、论文标题或 PDF,我负责: - 判断它应该进入 `jobs/`、`papers/` 还是 `references/`。 - 提取结构化 metadata。 - 建立 Markdown 笔记。 - 打标签和关联已有知识。 - 更新对应的 insight 文件。 适合: - 你平时看到的单条 JD。 - 朋友转来的内推信息。 - 某篇你觉得重要的论文。 - 临时想整理的一批资料。 ### 2. Live Web Sweep 你给我一个范围,我联网收集并整理。 例子: ```text 收集最近北京大厂 Agent 岗位 找最近三个月 Agent evaluation 相关论文 整理 DeepSeek 和腾讯的大模型应用岗位要求 找 coding agent 方向值得读的 10 篇论文 ``` 我会做: 1. 确认范围:时间、公司、地区、关键词、数量、优先级。 2. 在线检索:优先官方来源,其次可信平台和社区线索。 3. 去重:按标题、公司、岗位、URL、日期或论文 DOI/arXiv ID 去重。 4. 记录来源:每条资料都保留 `source_url` 和 `collected_at`。 5. 结构化:生成 `jobs/items/` 或 `papers/items/` 笔记。 6. 提炼判断:更新 `market-insights.md` 或 `paper-insights.md`。 7. 回流知识:标记需要更新的 `docs/`、`experiments/`、`projects/`。 ### 3. Batch Import 你给我一批链接、CSV、Markdown、浏览器书签或网页导出,我批量处理。 适合: - 招聘网站搜索结果。 - arXiv 搜索结果。 - 论文清单。 - 朋友发来的岗位合集。 批量导入会先生成候选清单,不急着全部写成完整笔记。优先级高的条目才进入深度整理。 ### 4. Future Automation 当资料量足够大后,再加自动化。 候选能力: - 从 Markdown frontmatter 生成 `index.json`。 - 生成搜索、筛选、时间线和标签页。 - 定期检查 JD 是否过期。 - 定期拉取论文搜索结果。 - 把 JD 技能和论文 topic 做关联图谱。 ## JD Collection ### Scope 默认范围: - location: 北京 - companies: DeepSeek、腾讯、字节、阿里、百度、美团、快手、京东、小米、智谱、月之暗面 - keywords: Agent、大模型、LLM、RAG、智能体、模型评估、AI Infra、代码智能、AI 产品 ### Source Priority 1. 公司官方招聘站和官方发布。 2. 主流招聘平台。 3. 技术社区、社交平台和内推帖。 4. 转载和聚合结果。 ### Output 每轮 JD 收集输出三类东西: - raw items: `jobs/items/*.md` - trend update: `jobs/market-insights.md` - taxonomy update: `jobs/skill-taxonomy.md` ### JD Extraction Focus 我不会只复制岗位描述,而会重点抽取: - 硬性技能要求。 - 高频加分项。 - 业务方向。 - 工程成熟度要求。 - 对 Agent 能力的隐含定义。 - 和论文、实验、项目的关联。 - 我们知识库还缺什么。 ### Example Prompt ```text 收集本周北京 DeepSeek、腾讯、字节的 Agent / LLM 应用岗位,优先官方来源,每家公司至少 3 条,如果官方不足再补招聘平台。 ``` ## Paper Collection ### Scope 默认主题: - Agent architecture - Tool use - Memory - RAG - Evaluation - Multi-agent - Coding agent - Human-in-the-loop - Computer use ### Source Priority 1. 论文原始页面、arXiv、OpenReview、ACL Anthology。 2. 会议 proceedings。 3. 作者或项目官方 GitHub。 4. Papers with Code 和研究博客。 5. 二手解读文章。 ### Output 每轮论文收集输出三类东西: - queue entries: `papers/reading-queue.md` - paper notes: `papers/items/*.md` - research update: `papers/paper-insights.md` ### Paper Triage Focus 我会优先判断: - 这篇论文是否解决 Agent 核心问题。 - 有没有明确实验或 benchmark。 - 有没有可复现代码或数据。 - 是否和 JD 高频技能呼应。 - 是否能转成实验。 - 是否值得沉淀进 `docs/`。 ### Example Prompt ```text 找最近 6 个月 Agent evaluation 方向最值得读的论文,优先有 benchmark 或代码的,整理成 reading queue。 ``` ## Cross-linking JD 和论文必须互相打通。 一个技能或概念最好能形成这样的链路: ```text Job requirement -> Paper evidence -> Experiment validation -> Project practice -> Docs conclusion ``` 例子: ```text agent-evaluation jobs: 哪些公司要求模型评估、Agent benchmark、线上观测 papers: 哪些论文定义评估方法和 benchmark experiments: 我们能否复现实验或搭一个 eval harness projects: 哪些项目需要这套评估能力 docs: 稳定结论沉淀到 Evaluation and Observability ``` ## Quality Rules - 时效信息必须带 `collected_at`。 - 重要事实必须带来源。 - 资料摘要和个人判断分开写。 - 不用一个目录决定归类,使用 metadata 多标签。 - 不确定的内容标记为 `unknown` 或 `needs verification`。 - 过期 JD 不删除,改状态并保留原因。 - 论文没有读完时只进入 queue,不伪装成已总结。 ## Review Rhythm 建议先用轻量节奏: | Rhythm | JD | Papers | | --- | --- | --- | | Weekly | 新增岗位、明显变化 | 新论文线索、阅读队列 | | Monthly | 市场技能趋势 | 主题研究洞察 | | Quarterly | 能力缺口和学习路线 | 成熟结论回流 `docs/` | ## What I Need From You 默认我可以直接开始收集,但如果你给出这些约束,结果会更准: - 优先公司名单。 - 是否只看北京。 - 是否看实习、校招、社招。 - 岗位偏工程、研究、产品还是综合。 - 论文偏最新趋势、经典必读,还是能直接指导项目实现。 - 每轮希望收集多少条。