English | 简体中文 | 日本語 | 한국어 | Español | Français | Deutsch | Português | Türkçe | العربية | हिन्दी | Русский
⚠️ 机器翻译声明本文档由 AI 自动翻译生成。虽然我们努力确保翻译质量,但可能存在不准确或不自然的表述。
欢迎通过 GitHub Issue #260 帮助改进翻译!您的反馈对我们非常宝贵。
🧠 面向 AI 系统的数据层。 Skill Seekers 可以把文档站点、GitHub 仓库、PDF、视频、Notebook、Wiki 等 18 种数据源 转换成结构化知识资产,直接用于 AI Skills(Claude、Gemini、OpenAI)、RAG 流水线(LangChain、LlamaIndex、Pinecone)以及 AI 编程助手(Cursor、Windsurf、Cline)。准备一次,导出到 22 个目标平台。
Atlas Cloud — A full-modal, OpenAI-compatible AI inference platform. Skill Seekers supports it as a packaging/enhancement target via --target atlas with ATLAS_API_KEY.
# 1. 安装
pip install skill-seekers
# 2. 从任意数据源创建技能
skill-seekers create https://docs.djangoproject.com/
# 3. 为你的 AI 平台打包
skill-seekers package output/django --target claude现在你已经得到了 output/django-claude.zip,可以直接使用。
# 选择用于增强的其他 AI agent(默认:claude)
skill-seekers create https://docs.djangoproject.com/ --agent kimi
skill-seekers create https://docs.djangoproject.com/ --agent-cmd "my-custom-agent run"把 scan 指向一个项目,AI agent 会读取它的清单文件、README、Dockerfile/CI 以及抽样的源码 import —— 然后为检测到的每个框架输出一份配置,并额外生成一份对应你自己代码的 <project>-codebase.json:
skill-seekers scan ./my-react-app --out ./configs/scanned/
# → react.json、vite.json、tailwind.json、jest.json、my-react-app-codebase.json
skill-seekers create ./configs/scanned/react.json如果某个检测结果没有现成的预设,AI 会生成一份全新的配置;退出时你可以选择把它发布回社区配置仓库。
skill-seekers create facebook/react # GitHub 仓库
skill-seekers create ./my-project # 本地代码库
skill-seekers create manual.pdf # PDF
skill-seekers create report.docx # Word
skill-seekers create book.epub # EPUB
skill-seekers create notebook.ipynb # Jupyter
skill-seekers create openapi.yaml # OpenAPI/Swagger
skill-seekers create presentation.pptx # PowerPoint
skill-seekers create guide.adoc # AsciiDoc
skill-seekers create page.html # 本地 HTML(也可以是整个目录)
skill-seekers create feed.rss # RSS/Atom
skill-seekers create curl.1 # Man 手册页
# 视频(YouTube、Vimeo 或本地文件 —— 需要 skill-seekers[video])
skill-seekers create --video-url https://www.youtube.com/watch?v=... --name mytutorial
skill-seekers create --setup # 自动安装适配 GPU 的视觉依赖
skill-seekers create --space-key TEAM --name wiki # Confluence
skill-seekers create --database-id ... --name docs # Notion
skill-seekers create --chat-export-path ./slack-export --name team-chat # Slack/Discord每种数据源类型及其可用选项详见抓取指南。
pip install skill-seekers # 核心:抓取、GitHub、PDF、打包
pip install skill-seekers[all-llms] # + 所有 LLM 平台
pip install skill-seekers[mcp] # + MCP 服务器
pip install skill-seekers[all] # 全部功能不确定该装哪些? 运行安装向导:skill-seekers-setup
全部可选安装项
| 安装命令 | 新增能力 |
|---|---|
skill-seekers[gemini] |
Google Gemini 支持 |
skill-seekers[openai] |
OpenAI ChatGPT 支持 |
skill-seekers[all-llms] |
所有 LLM 平台 |
skill-seekers[mcp] |
面向 Claude Code、Cursor 等的 MCP 服务器 |
skill-seekers[video] |
YouTube/Vimeo 字幕与元数据提取 |
skill-seekers[video-full] |
+ Whisper 语音转写与视觉帧提取 |
skill-seekers[jupyter] |
Jupyter Notebook 支持 |
skill-seekers[pptx] |
PowerPoint 支持 |
skill-seekers[confluence] |
Confluence wiki 支持 |
skill-seekers[notion] |
Notion 页面支持 |
skill-seekers[rss] |
RSS/Atom 订阅源支持 |
skill-seekers[chat] |
Slack/Discord 聊天记录导出支持 |
skill-seekers[asciidoc] |
AsciiDoc 支持 |
skill-seekers[all] |
全部功能 |
视频视觉依赖(GPU 感知): 安装
skill-seekers[video-full]之后,运行skill-seekers create --setup自动检测 GPU 并安装匹配的 PyTorch 版本与 easyocr。
前置条件: Python 3.10+、Git。第一次使用?→ 零障碍快速上手 🎯
| 我想要…… | 阅读这里 |
|---|---|
| 快速上手 | 快速开始 —— 3 条命令做出第一个技能 |
| 理解核心概念 | 核心概念 |
| 抓取数据源 | 抓取指南 —— 全部 18 种数据源类型 |
| 用 AI 增强技能 | 增强指南 · 增强模式 |
| 导出技能 | 打包指南 |
| 构建工作流 | 工作流 |
| 查询某条命令 | CLI 参考 —— 全部 19 条命令 |
| 进行配置 | 配置格式 · 环境变量 |
| 配置 MCP | MCP 配置 · MCP 参考 |
| 与 RAG / IDE 集成 | LangChain · RAG 流水线 · Cursor · Windsurf · Cline |
| 处理超大文档集 | 超大文档处理 —— 10K–40K+ 页 |
| 理解整体架构 | UML 架构 —— 14 张图 |
| 解决问题 | 故障排查 |
完整文档索引: docs/README.md
| 使用场景 | 产出 | 赋能对象 |
|---|---|---|
| AI Skills | 内容完整的 SKILL.md + 参考文件 |
Claude Code、Gemini、GPT |
| RAG 流水线 | 带丰富元数据的分块文档 | LangChain、LlamaIndex、Haystack |
| 向量数据库 | 预格式化、可直接 upsert 的数据 | Pinecone、Chroma、Weaviate、FAISS、Qdrant |
| AI 编程助手 | IDE 内 AI 自动读取的上下文文件 | Cursor、Windsurf、Cline、Continue.dev |
skill-seekers package output/react --target claude # → Claude Skill(ZIP + YAML)
skill-seekers package output/react --target langchain # → LangChain Documents
skill-seekers package output/react --target llama-index # → LlamaIndex TextNodes
skill-seekers package output/react --target ibm-bob # → IBM Bob 技能目录LLM 平台(12 个): claude · gemini · openai · minimax · opencode · kimi · deepseek · qwen · openrouter · together · fireworks · markdown
RAG 与向量(8 个): langchain · llama-index · haystack · chroma · faiss · weaviate · qdrant · pinecone
其他(2 个): atlas · ibm-bob
各平台的具体支持情况详见功能矩阵。
- ⚡ 快 99% —— 原本数天的人工数据准备 → 15–45 分钟
- 🎯 真正可用的技能质量 —— 500+ 行的
SKILL.md文件,包含示例、模式与指南 - 📊 开箱即用的 RAG 分块 —— 智能分块保留代码块与上下文
- 🔄 多源融合 —— 把文档 + GitHub + PDF + 视频合并为一份知识资产
- 🌐 一次准备,通吃所有目标 —— 无需重新抓取即可导出到 22 个目标平台
- ✅ 久经考验 —— 3,900+ 测试、68 个工作流预设,可用于生产环境
文档抓取 —— SPA 发现、llms.txt、智能分类
针对 JavaScript SPA 站点的三层发现机制(sitemap.xml → llms.txt → 无头浏览器渲染)、自动检测 llms.txt(存在时速度提升 10 倍)、智能主题分类,以及宽松的 HTML 解析器兜底,让标记破损的页面也能顺利抓取。
→ 抓取指南 · llms.txt 支持
GitHub 与代码库分析(C3.x) —— AST 解析、模式检测、操作指南
三路并行架构:代码分析(AST、设计模式、测试)、文档(README、docs/、wiki)以及社区(issues、PR、元数据)。C3.x 流水线还提供覆盖 9 种语言的 10 种 GoF 模式检测器、从测试中提取的用法示例、AI 撰写的操作指南、配置提取以及架构总览。
skill-seekers create ./my-project --preset quick # 1–2 分钟,浅层分析
skill-seekers create ./my-project --preset standard # 均衡(默认)
skill-seekers create ./my-project --preset comprehensive # 深度、详尽AI 增强 —— API 或本地 agent,68 个工作流预设
所有 AI 调用都经由同一条传输通道,可运行在 API 模式(Anthropic、Google Gemini、OpenAI、Moonshot/Kimi、MiniMax)或 LOCAL 模式(Claude Code、Kimi Code、Codex、Copilot、OpenCode、自定义 agent —— 无 API 费用)。用 --enhance-level 0-3 控制增强深度,用 --agent 选择 agent。
→ 增强指南 · 增强模式 · 多 Agent 配置
视频提取 —— 文字稿、视频帧、屏幕上的代码
支持 YouTube、Vimeo 和本地文件。三级文字稿兜底(内嵌字幕 → YouTube 字幕 API → 本地 Whisper),并可选启用视觉提取,对抽样帧中显示的代码做 OCR。
→ 视频指南
质量、同步与规模
带门禁阈值的质量评分(skill-seekers quality output/react/ --threshold 7)、文档变更检测配合定时重抓与通知、面向超大文档集的流式摄取,以及增量更新。
Skill Seekers 自带一个 MCP 服务器,支持 Claude Code、Cursor、Windsurf、VS Code + Cline 以及 IntelliJ IDEA。
# stdio 模式(Claude Code、VS Code + Cline)
python -m skill_seekers.mcp.server_fastmcp
# HTTP 模式(Cursor、Windsurf、IntelliJ)
python -m skill_seekers.mcp.server_fastmcp --transport http --port 8765然后直接对你的助手说:“打包并上传 React 技能。”
技能可自动安装到 19 个 AI 编程 agent:
skill-seekers install-agent output/react/ --agent cursor
skill-seekers install-agent output/react/ --agent all # 所有检测到的 agent
skill-seekers install-agent output/react/ --agent cursor --dry-run| Agent | 路径 | 作用范围 |
|---|---|---|
| Claude Code | ~/.claude/skills/ |
全局 |
| Cursor | .cursor/skills/ |
项目 |
| VS Code / Copilot | .github/skills/ |
项目 |
| Amp | ~/.amp/skills/ |
全局 |
| Goose | ~/.config/goose/skills/ |
全局 |
| OpenCode | ~/.opencode/skills/ |
全局 |
| Letta | ~/.letta/skills/ |
全局 |
| Aide | ~/.aide/skills/ |
全局 |
| Windsurf | ~/.windsurf/skills/ |
全局 |
| Neovate | ~/.neovate/skills/ |
全局 |
| Roo Code | .roo/skills/ |
项目 |
| Cline | .cline/skills/ |
项目 |
| Aider | ~/.aider/skills/ |
全局 |
| Bolt | .bolt/skills/ |
项目 |
| Kilo Code | .kilo/skills/ |
项目 |
| Continue | ~/.continue/skills/ |
全局 |
| Kimi Code | ~/.kimi/skills/ |
全局 |
| IBM Bob | .bob/skills/ |
项目 |
export ANTHROPIC_API_KEY=sk-ant-...
skill-seekers package output/react/ --upload # 打包 + 上传
skill-seekers upload output/react.zip # 上传已有的 zip没有 API key?先打包,然后在 claude.ai/skills 手动上传 output/react.zip。
→ 上传指南
graph LR
A[Documentation Website] --> B[Skill Seekers]
B --> C[Scraper]
B --> D[AI Enhancement]
B --> E[Packager]
C --> F[Organized References]
D --> F
F --> E
E --> G[AI Skill .zip]
G --> H[Upload to AI Platform]
- 抓取 —— 提取每一个页面(优先检查
llms.txt) - 分类 —— 把内容按主题组织(API、指南、教程……)
- 增强 —— AI 撰写一份内容完整、带示例的
SKILL.md - 打包 —— 打成平台可直接使用的产物
- 上传 —— 发布到你的 AI 平台(可选)
8 个核心模块 + 5 个工具模块(约 200 个类):
| 模块 | 用途 |
|---|---|
| CLICore | Git 风格的命令分发器、数据源自动检测 |
| Scrapers | 基于共享构建层的 18 种数据源提取器 |
| Adaptors | 统一 SkillAdaptor 抽象基类背后的 22 种输出平台格式 |
| Analysis | C3.x 代码库分析流水线、10 种 GoF 模式检测器 |
| Enhancement | 通过单一 AgentClient 传输通道进行 AI 增强 |
| Packaging | 打包、上传与安装技能 |
| MCP | FastMCP 服务器(40 个工具、10 个工具模块) |
| Sync | 文档变更检测与通知 |
- 针对破损标记的 HTML 解析器兜底(#96)—— 严重畸形的页面不再被抓取成空内容;格式良好的页面输出保持字节级一致。
- 瞬时故障重试 —— 文档抓取器(#97)与 MCP
fetch_config(#92)现在会以退避策略重试连接抖动和 5xx;4xx 仍然快速失败。 - Whisper 转写兜底(#420)—— 没有字幕的本地视频终于能得到真正的文字稿。
- MiniMax 图像 OCR + 注册表驱动的多模态提供方(#423)—— 各提供方自行声明传输协议与图像能力;中国区签发的 key 可以对接正确的端点。
- 更省 token 的 GitHub issue 默认值(#169)—— GitHub 技能默认不再打包完整的已关闭 issue 历史。
- 三个服务器统一采用环境变量驱动的 CORS(#422、#424)—— 不再出现通配来源搭配凭据的情况。
完整变更历史:CHANGELOG.md
| 文档规模 | 耗时 | 产出体积 |
|---|---|---|
| 小型(< 100 页) | 5–10 分钟 | 约 2 MB |
| 中型(100–500 页) | 15–30 分钟 | 约 10 MB |
| 大型(500–2,000 页) | 30–60 分钟 | 约 40 MB |
| 超大型(10K–40K+ 页) | 使用 stream |
参见超大文档处理 |
skill-seekers doctor # 诊断安装与运行环境
skill-seekers sync-config # 检测配置漂移常见问题与解决办法:故障排查指南 · TROUBLESHOOTING.md
欢迎贡献 —— 详见 CONTRIBUTING.md。
MIT —— 详见 LICENSE。
Skill Seekers 是一个多仓库项目:
| 仓库 | 说明 | 链接 |
|---|---|---|
| Skill_Seekers | 核心 CLI 与 MCP 服务器(本仓库) | PyPI |
| skillseekersweb | 官网与文档 | 在线访问 |
| skill-seekers-configs | 社区配置仓库 | |
| skill-seekers-action | 用于 CI/CD 的 GitHub Action | |
| skill-seekers-plugin | Claude Code 插件 | |
| homebrew-skill-seekers | 面向 macOS 的 Homebrew tap |
想要参与贡献? 官网仓库和配置仓库是新贡献者非常好的起点!



