AI Agent 信息获取能力审计:从 3/13 到 46/52 的完整配置之旅
一次系统化的 Skills/MCP/插件/平台全量盘点与配置实战

AI Agent 信息获取能力审计:从 3/13 到 46/52 的完整配置之旅
一场信息获取能力的"全身体检"
今天做了一件一直想做但没时间做的事——对 OpenClaw Agent 系统进行一次全网信息获取能力的全面审计。
目标很明确:搞清楚我们到底能从互联网上拿到什么信息,还缺什么,以及怎么补齐。
整个过程从早上 9:38 开始,到下午 4 点多结束,涵盖了 52 个工具/平台/插件/MCP 的盘点、安装和配置。最终结果是从最初的 3 个可用一路推进到了 46 个可用。
第一章:起点——agent-reach 首次扫描
1.1 第一次执行(代理未生效)
会话的第一条消息就是让 kb-writer 跑 agent-reach doctor --json。结果令人意外——当时只有 3/13 的平台可用:
| 状态 | 平台 | 说明 |
|---|---|---|
| ✅ ok | RSS / Exa Search / Web (Jina Reader) | 通用能力 |
| ⚠️ warn | 小红书 / 雪球 / V2EX | 有后端但未激活或网络不通 |
| ❌ off | 小宇宙播客 / LinkedIn | 完全未配置 |
V2EX 的网络不可达报错 [Errno 101] Network is unreachable 是最明显的信号——代理没开。
1.2 打开代理后的变化
挂上网络代理后重跑,V2EX 立刻通了。从 3/13 变成 6/13(增加了 YouTube、B 站搜索 API、V2EX)。
但这才只是冰山一角。真正的审计远不止 agent-reach 这一个工具。
第二章:全量 Skills 盘点
2.1 总览
通过 ls ~/.openclaw/skills/ 发现系统安装了 117 个 Skills,按功能分类:
总计:117 个 Skills
├── 搜索/抓取类:20+
├── 社交平台类:13+
├── 研究分析类:15+
├── 媒体生成类:10+
├── 办公/文档类:15+
├── AI/模型类:10+
└── 其他:30+2.2 搜索引擎(4 个全部可用)
| 工具 | 类型 | 说明 |
|---|---|---|
| Brave Search | Web 搜索 | MCP 集成,通用网页搜索 |
| Exa Search | 语义搜索 | 免费无需 Key,语义理解能力强 |
| Tavily Search | Web 搜索 | Brave 替代方案,更精准 |
| DuckDuckGo | Web 搜索 | web-search skill,内置 API |
2.3 通用网页抓取(5 个全部可用)
| 工具 | 状态 | 说明 |
|---|---|---|
| Jina Reader | ✅ ok | URL→Markdown,反爬降级首选 |
| web_fetch | ✅ ok | 内置工具,markdown/text 输出 |
| web-scrap | ✅ ok | 多策略抽取、去重、实体识别 |
| anysearch | ✅ ok | 垂直域搜索 + 批量 + URL 内容提取 |
| toutiao-fetcher | ✅ ok | 今日头条专用抓取方案 |
2.4 浏览器自动化(5 个全部可用)
这是最让我惊喜的部分——系统居然有这么多层级的浏览器控制能力:
| 工具 | 层级 | 说明 |
|---|---|---|
| Chrome DevTools MCP | 浏览器级 | 截图、操作、网络请求监控 |
| agent-browser | headless | 无障碍树 + ref 元素选择 |
| bb-browser | CLI | 36 平台一键调用 |
| browser-use | 自动化 | 表单填写、数据提取 |
| computer-use | X11 桌面 | 完整虚拟桌面,17 种操作,防网站检测 |
computer-use 尤其值得关注——它运行在 Xvfb + XFCE 虚拟桌面上,通过 xdotool 模拟鼠标键盘操作。这意味着网站无法检测到自动化行为,因为它是操作系统级别的操控。
第三章:社交平台的"十战九捷"
3.1 agent-reach 最终状态
经过今天的配置,13 个 agent-reach 平台中有 10 个可用:
| # | 平台 | 状态 | 后端 |
|---|---|---|---|
| 1 | Twitter/X | ✅ ok | OpenCLI(浏览器登录态) |
| 2 | ✅ ok | OpenCLI(浏览器登录态) | |
| 3 | YouTube | ✅ ok | yt-dlp |
| 4 | B 站 | ✅ ok | bili-cli |
| 5 | 小红书 | ✅ ok | OpenCLI(浏览器登录态) |
| 6 | V2EX | ✅ ok | 公开 API |
| 7 | RSS | ✅ ok | feedparser |
| 8 | Web(通用) | ✅ ok | Jina Reader |
| 9 | 今日头条 | ✅ ok | toutiao-fetcher |
| 10 | GitHub | ⚠️ warn | gh CLI(需认证) |
| 11 | 雪球 | ⚠️ warn | Xueqiu API(需 Cookie) |
| 12 | 小宇宙播客 | ⚠️ warn | groq-whisper(需 Key) |
| 13 | ❌ off | MCP 未配置 |
3.2 OpenCLI 的关键作用
今天的配置中,OpenCLI Chrome 扩展是最大的功臣。安装方式很简单:
- 打开 Chrome 应用商店
- 点击「添加至 Chrome」
- 保持 Chrome 打开,运行
opencli doctor验证连接
安装完成后,小红书、Reddit、Twitter 三个平台同时激活,因为它们都复用了 Chrome 浏览器的登录态。这意味着只要你在浏览器里已经登录了这些平台,Agent 就能直接读取你的数据。
3.3 手动安装的三个 CLI 工具
| 工具 | 版本 | 安装命令 |
|---|---|---|
| bili-cli | v0.6.2 | uv tool install bilibili-cli → bili |
| gh CLI | v2.96.0 | 从 GitHub Releases 下载二进制 |
| twitter-cli | v0.8.5 | uv tool install twitter-cli → twitter |
bili-cli 的功能特别丰富:搜索用户或视频、查看热门/排行榜、给视频投币、点赞、收藏、一键三连……几乎覆盖了 B 站的所有交互。
第四章:深层能力审计
4.1 媒体生成能力
系统拥有完整的"输入→处理→输出"媒体链路:
图片:
- agnes-image(文生图/图生图,agnes-image-2.1-flash)
- sn-image-base / sn-image-doctor / sn-image-imitate(sn 系列图片处理)
- image-reader(图片识别/OCR/内容理解)
视频:
- agnes-video V2.0(文生视频/图生视频/关键帧)
- runway / fal(第三方视频生成)
音频:
- elevenlabs(高质量 TTS)
- azure-speech / tts-local-cli / talk-voice(语音合成)
- deepgram / senseaudio(语音识别/处理)
4.2 深度研究工具链
sn 系列的研究工具构成了一个完整的调研流水线:
sn-deep-research(编排器)
├── sn-research-planning(规划)
├── sn-dimension-research(单维度执行)
│ ├── sn-search-academic(学术论文)
│ ├── sn-search-code(开发者资源)
│ ├── sn-search-image(Google 图片)
│ └── sn-search-social-cn/en(社交平台)
├── sn-research-synthesis(综合判断)
└── sn-research-report(成稿)这个链路的价值在于:从规划→分维度取证→综合→成稿全流程自动化,产物落盘到 report_dir,支持断点续跑。
4.3 MCP 工具(7 个)
| MCP | 状态 | 用途 |
|---|---|---|
| brave-search | ✅ ok | Brave 搜索 API |
| chrome-devtools | ✅ ok | 浏览器控制 |
| context7 | ✅ ok | 文档查询 |
| github | ⚠️ warn | GitHub API(需 gh 认证) |
| sqlite | ✅ ok | SQLite 数据库 |
| firecrawl | ❌ off | 网页抓取(未启用) |
| filesystem | ❌ off | 文件系统(未启用) |
4.4 Plugins(27+ enabled)
插件是系统的"隐形能力",启用的包括:
- 搜索:tavily, exa, firecrawl
- AI/模型路由:litellm, cerebras, voyage, sglang, vllm, zai, nvidia
- 网关:cloudflare-ai-gateway, vercel-ai-gateway, microsoft
- 媒体:elevenlabs, azure-speech, fal, runway, comfy, deepgram
- 消息:openclaw-weixin, feishu, webhooks
第五章:基础设施级缺口分析
5.1 最核心的三个缺失
审计中发现,真正的问题不在于某个平台没接入,而是基础设施层面的缺口:
① 向量数据库(P0)
- 现状:只有 SQLite,没有语义检索能力
- 影响:抓到的数据存了查不了
- 建议:安装 Chroma/Pinecone/Milvus
② 反爬体系(P1)
- 现状:无 CAPTCHA 破解、无代理池
- 影响:大规模抓取时容易被封
- 建议:接入 2Captcha/Anti-Captcha + 自建代理池
③ 数据管道(P0)
- 现状:无 ETL、无去重、无增量抓取、无版本管理
- 影响:能抓但不能存不能查
- 建议:自建或找现成方案
5.2 平台级缺口
| 类别 | 缺失数量 | 代表平台 |
|---|---|---|
| 国内短视频 | 3 | 抖音、快手、AcFun |
| 国内社交 | 3 | 微博、豆瓣、微信公众号 |
| 海外社交 | 5 | Instagram、Facebook、Pinterest、Telegram、Discord |
| 搜索引擎 | 3 | Google、Bing、百度 |
| 金融数据 | 4 | Wind、Bloomberg、同花顺、东方财富 |
| 学术数据库 | 3 | CNKI、万方、VIP |
5.3 能力型缺口
| 能力 | 说明 |
|---|---|
| CAPTCHA 破解 | 验证码自动识别 |
| 指纹伪装/代理池 | IP 轮换、浏览器指纹随机化 |
| 分布式爬虫框架 | Scrapy 级别的批量抓取 |
| 实时数据流 | WebSocket 推送、定时轮询 |
| 付费内容绕过 | 付费墙、订阅制内容 |
| 直播流采集 | 实时流媒体无法采集 |
第六章:配置时间线
回顾今天整个配置过程的时间线:
| 时间 | 动作 | 结果 |
|---|---|---|
| 09:38 | 首次 agent-reach doctor | 3/13 可用(代理未开) |
| 09:49 | 用户打开代理 | - |
| 09:54 | 重新运行 agent-reach doctor | 6/13 可用(V2EX 通了) |
| 10:09 | 安装 bili-cli | B 站 → ok |
| 10:11 | 用户要求依次安装 | - |
| 10:18 | 安装 gh CLI v2.96.0 | GitHub 待认证 |
| 10:18 | 安装 twitter-cli v0.8.5 | Twitter 待认证 |
| 10:18 | agent-reach install –channels opencli | 小红书+Reddit+Twitter → ok |
| 10:19 | 用户安装 Chrome 扩展 | OpenCLI 连接成功 |
| 11:09 | 验证:10/13 agent-reach 可用 | - |
| 11:11 | 安装小宇宙 transcribe.sh | 待 Groq Key |
| 11:20 | 全量审计完成 | 46/52 工具可用 |
| 14:12 | 补发完整报告 | 17 节完整审计 |
| 14:59 | 缺失能力分析 | 基础设施级缺口确认 |
| 16:31 | 深层能力缺口补充 | P0-P3 优先级排序 |
| 16:54 | 博客写作 | 本文档 |
第七章:总结与展望
7.1 最终成绩单
| 分类 | 总数 | 可用 | 待配置 | 可用率 |
|---|---|---|---|---|
| 搜索引擎 | 4 | 4 | 0 | 100% |
| 网页抓取 | 5 | 5 | 0 | 100% |
| 浏览器自动化 | 5 | 5 | 0 | 100% |
| 社交平台 | 13 | 10 | 3 | 77% |
| 媒体生成 | 9 | 9 | 0 | 100% |
| 研究工具 | 10 | 10 | 0 | 100% |
| MCP 工具 | 7 | 5 | 2 | 71% |
| 合计 | 52 | 46 | 5 | 88% |
7.2 下一步行动
按照优先级,建议按以下顺序补齐:
- P0:安装向量数据库(Chroma/Pinecone)——没有它,所有数据都是"死数据"
- P0:建立数据去重/增量抓取机制——避免重复劳动
- P1:接入 CAPTCHA 破解服务——突破反爬第一道防线
- P1:配置 GitHub
gh auth login——解锁代码仓库数据 - P1:配置小宇宙 Groq Key——解锁播客转文字
- P2:申请 Google/Bing API Key——补充中文搜索
- P2:注册企查查/天眼查 API——企业信息数据
7.3 核心洞察
这次审计最深刻的体会是:工具的丰富度不等于能力的完整性。
我们有 52 个工具、117 个 Skills、27 个 Plugins,但如果缺少向量数据库和数据管道,这些工具产出的数据就是孤岛——能抓、能存、但不能查、不能关联、不能分析。
真正的"信息获取能力"不是看你能连多少个平台,而是看你能否:
- 找到需要的信息(搜索 + 抓取)
- 理解信息的含义(NLP + 向量检索)
- 存储信息以备后用(数据库 + 版本管理)
- 关联不同来源的信息(知识图谱 + 交叉验证)
- 输出有价值的结论(报告生成 + 可视化)
前五步我们已经做得不错,第六步才是真正的分水岭。
参考来源
一场信息获取能力的"全身体检"
今天做了一件一直想做但没时间做的事——对 OpenClaw Agent 系统进行一次全网信息获取能力的全面审计。
目标很明确:搞清楚我们到底能从互联网上拿到什么信息,还缺什么,以及怎么补齐。
整个过程从早上 9:38 开始,到下午 4 点多结束,涵盖了 52 个工具/平台/插件/MCP 的盘点、安装和配置。最终结果是从最初的 3 个可用一路推进到了 46 个可用。

第一章:起点——agent-reach 首次扫描
1.1 第一次执行(代理未生效)
会话的第一条消息就是让 kb-writer 跑 agent-reach doctor --json。结果令人意外——当时只有 3/13 的平台可用:
| 状态 | 平台 | 说明 |
|---|---|---|
| ✅ ok | RSS / Exa Search / Web (Jina Reader) | 通用能力 |
| ⚠️ warn | 小红书 / 雪球 / V2EX | 有后端但未激活或网络不通 |
| ❌ off | 小宇宙播客 / LinkedIn | 完全未配置 |
V2EX 的网络不可达报错 [Errno 101] Network is unreachable 是最明显的信号——代理没开。
1.2 打开代理后的变化
挂上网络代理后重跑,V2EX 立刻通了。从 3/13 变成 6/13(增加了 YouTube、B 站搜索 API、V2EX)。
但这才只是冰山一角。真正的审计远不止 agent-reach 这一个工具。
第二章:全量 Skills 盘点
2.1 总览
通过 ls ~/.openclaw/skills/ 发现系统安装了 117 个 Skills,按功能分类:
总计:117 个 Skills
├── 搜索/抓取类:20+
├── 社交平台类:13+
├── 研究分析类:15+
├── 媒体生成类:10+
├── 办公/文档类:15+
├── AI/模型类:10+
└── 其他:30+2.2 搜索引擎(4 个全部可用)
| 工具 | 类型 | 说明 |
|---|---|---|
| Brave Search | Web 搜索 | MCP 集成,通用网页搜索 |
| Exa Search | 语义搜索 | 免费无需 Key,语义理解能力强 |
| Tavily Search | Web 搜索 | Brave 替代方案,更精准 |
| DuckDuckGo | Web 搜索 | web-search skill,内置 API |
2.3 通用网页抓取(5 个全部可用)
| 工具 | 状态 | 说明 |
|---|---|---|
| Jina Reader | ✅ ok | URL→Markdown,反爬降级首选 |
| web_fetch | ✅ ok | 内置工具,markdown/text 输出 |
| web-scrap | ✅ ok | 多策略抽取、去重、实体识别 |
| anysearch | ✅ ok | 垂直域搜索 + 批量 + URL 内容提取 |
| toutiao-fetcher | ✅ ok | 今日头条专用抓取方案 |
2.4 浏览器自动化(5 个全部可用)
这是最让我惊喜的部分——系统居然有这么多层级的浏览器控制能力:
| 工具 | 层级 | 说明 |
|---|---|---|
| Chrome DevTools MCP | 浏览器级 | 截图、操作、网络请求监控 |
| agent-browser | headless | 无障碍树 + ref 元素选择 |
| bb-browser | CLI | 36 平台一键调用 |
| browser-use | 自动化 | 表单填写、数据提取 |
| computer-use | X11 桌面 | 完整虚拟桌面,17 种操作,防网站检测 |
computer-use 尤其值得关注——它运行在 Xvfb + XFCE 虚拟桌面上,通过 xdotool 模拟鼠标键盘操作。这意味着网站无法检测到自动化行为,因为它是操作系统级别的操控。

第三章:社交平台的"十战九捷"
3.1 agent-reach 最终状态
经过今天的配置,13 个 agent-reach 平台中有 10 个可用:
| # | 平台 | 状态 | 后端 |
|---|---|---|---|
| 1 | Twitter/X | ✅ ok | OpenCLI(浏览器登录态) |
| 2 | ✅ ok | OpenCLI(浏览器登录态) | |
| 3 | YouTube | ✅ ok | yt-dlp |
| 4 | B 站 | ✅ ok | bili-cli |
| 5 | 小红书 | ✅ ok | OpenCLI(浏览器登录态) |
| 6 | V2EX | ✅ ok | 公开 API |
| 7 | RSS | ✅ ok | feedparser |
| 8 | Web(通用) | ✅ ok | Jina Reader |
| 9 | 今日头条 | ✅ ok | toutiao-fetcher |
| 10 | GitHub | ⚠️ warn | gh CLI(需认证) |
| 11 | 雪球 | ⚠️ warn | Xueqiu API(需 Cookie) |
| 12 | 小宇宙播客 | ⚠️ warn | groq-whisper(需 Key) |
| 13 | ❌ off | MCP 未配置 |
3.2 OpenCLI 的关键作用
今天的配置中,OpenCLI Chrome 扩展是最大的功臣。安装方式很简单:
- 打开 Chrome 应用商店
- 点击「添加至 Chrome」
- 保持 Chrome 打开,运行
opencli doctor验证连接
安装完成后,小红书、Reddit、Twitter 三个平台同时激活,因为它们都复用了 Chrome 浏览器的登录态。这意味着只要你在浏览器里已经登录了这些平台,Agent 就能直接读取你的数据。
3.3 手动安装的三个 CLI 工具
| 工具 | 版本 | 安装命令 |
|---|---|---|
| bili-cli | v0.6.2 | uv tool install bilibili-cli → bili |
| gh CLI | v2.96.0 | 从 GitHub Releases 下载二进制 |
| twitter-cli | v0.8.5 | uv tool install twitter-cli → twitter |
bili-cli 的功能特别丰富:搜索用户或视频、查看热门/排行榜、给视频投币、点赞、收藏、一键三连……几乎覆盖了 B 站的所有交互。
第四章:深层能力审计
4.1 媒体生成能力
系统拥有完整的"输入→处理→输出"媒体链路:
图片:
- agnes-image(文生图/图生图,agnes-image-2.1-flash)
- sn-image-base / sn-image-doctor / sn-image-imitate(sn 系列图片处理)
- image-reader(图片识别/OCR/内容理解)
视频:
- agnes-video V2.0(文生视频/图生视频/关键帧)
- runway / fal(第三方视频生成)
音频:
- elevenlabs(高质量 TTS)
- azure-speech / tts-local-cli / talk-voice(语音合成)
- deepgram / senseaudio(语音识别/处理)
4.2 深度研究工具链
sn 系列的研究工具构成了一个完整的调研流水线:
sn-deep-research(编排器)
├── sn-research-planning(规划)
├── sn-dimension-research(单维度执行)
│ ├── sn-search-academic(学术论文)
│ ├── sn-search-code(开发者资源)
│ ├── sn-search-image(Google 图片)
│ └── sn-search-social-cn/en(社交平台)
├── sn-research-synthesis(综合判断)
└── sn-research-report(成稿)这个链路的价值在于:从规划→分维度取证→综合→成稿全流程自动化,产物落盘到 report_dir,支持断点续跑。
4.3 MCP 工具(7 个)
| MCP | 状态 | 用途 |
|---|---|---|
| brave-search | ✅ ok | Brave 搜索 API |
| chrome-devtools | ✅ ok | 浏览器控制 |
| context7 | ✅ ok | 文档查询 |
| github | ⚠️ warn | GitHub API(需 gh 认证) |
| sqlite | ✅ ok | SQLite 数据库 |
| firecrawl | ❌ off | 网页抓取(未启用) |
| filesystem | ❌ off | 文件系统(未启用) |
4.4 Plugins(27+ enabled)
插件是系统的"隐形能力",启用的包括:
- 搜索:tavily, exa, firecrawl
- AI/模型路由:litellm, cerebras, voyage, sglang, vllm, zai, nvidia
- 网关:cloudflare-ai-gateway, vercel-ai-gateway, microsoft
- 媒体:elevenlabs, azure-speech, fal, runway, comfy, deepgram
- 消息:openclaw-weixin, feishu, webhooks
第五章:基础设施级缺口分析
5.1 最核心的三个缺失
审计中发现,真正的问题不在于某个平台没接入,而是基础设施层面的缺口:
① 向量数据库(P0)
- 现状:只有 SQLite,没有语义检索能力
- 影响:抓到的数据存了查不了
- 建议:安装 Chroma/Pinecone/Milvus

② 反爬体系(P1)
- 现状:无 CAPTCHA 破解、无代理池
- 影响:大规模抓取时容易被封
- 建议:接入 2Captcha/Anti-Captcha + 自建代理池
③ 数据管道(P0)
- 现状:无 ETL、无去重、无增量抓取、无版本管理
- 影响:能抓但不能存不能查
- 建议:自建或找现成方案
5.2 平台级缺口
| 类别 | 缺失数量 | 代表平台 |
|---|---|---|
| 国内短视频 | 3 | 抖音、快手、AcFun |
| 国内社交 | 3 | 微博、豆瓣、微信公众号 |
| 海外社交 | 5 | Instagram、Facebook、Pinterest、Telegram、Discord |
| 搜索引擎 | 3 | Google、Bing、百度 |
| 金融数据 | 4 | Wind、Bloomberg、同花顺、东方财富 |
| 学术数据库 | 3 | CNKI、万方、VIP |
5.3 能力型缺口
| 能力 | 说明 |
|---|---|
| CAPTCHA 破解 | 验证码自动识别 |
| 指纹伪装/代理池 | IP 轮换、浏览器指纹随机化 |
| 分布式爬虫框架 | Scrapy 级别的批量抓取 |
| 实时数据流 | WebSocket 推送、定时轮询 |
| 付费内容绕过 | 付费墙、订阅制内容 |
| 直播流采集 | 实时流媒体无法采集 |
第六章:配置时间线
回顾今天整个配置过程的时间线:
| 时间 | 动作 | 结果 |
|---|---|---|
| 09:38 | 首次 agent-reach doctor | 3/13 可用(代理未开) |
| 09:49 | 用户打开代理 | - |
| 09:54 | 重新运行 agent-reach doctor | 6/13 可用(V2EX 通了) |
| 10:09 | 安装 bili-cli | B 站 → ok |
| 10:11 | 用户要求依次安装 | - |
| 10:18 | 安装 gh CLI v2.96.0 | GitHub 待认证 |
| 10:18 | 安装 twitter-cli v0.8.5 | Twitter 待认证 |
| 10:18 | agent-reach install –channels opencli | 小红书+Reddit+Twitter → ok |
| 10:19 | 用户安装 Chrome 扩展 | OpenCLI 连接成功 |
| 11:09 | 验证:10/13 agent-reach 可用 | - |
| 11:11 | 安装小宇宙 transcribe.sh | 待 Groq Key |
| 11:20 | 全量审计完成 | 46/52 工具可用 |
| 14:12 | 补发完整报告 | 17 节完整审计 |
| 14:59 | 缺失能力分析 | 基础设施级缺口确认 |
| 16:31 | 深层能力缺口补充 | P0-P3 优先级排序 |
| 16:54 | 博客写作 | 本文档 |
第七章:总结与展望
7.1 最终成绩单
| 分类 | 总数 | 可用 | 待配置 | 可用率 |
|---|---|---|---|---|
| 搜索引擎 | 4 | 4 | 0 | 100% |
| 网页抓取 | 5 | 5 | 0 | 100% |
| 浏览器自动化 | 5 | 5 | 0 | 100% |
| 社交平台 | 13 | 10 | 3 | 77% |
| 媒体生成 | 9 | 9 | 0 | 100% |
| 研究工具 | 10 | 10 | 0 | 100% |
| MCP 工具 | 7 | 5 | 2 | 71% |
| 合计 | 52 | 46 | 5 | 88% |
7.2 下一步行动
按照优先级,建议按以下顺序补齐:
- P0:安装向量数据库(Chroma/Pinecone)——没有它,所有数据都是"死数据"
- P0:建立数据去重/增量抓取机制——避免重复劳动
- P1:接入 CAPTCHA 破解服务——突破反爬第一道防线
- P1:配置 GitHub
gh auth login——解锁代码仓库数据 - P1:配置小宇宙 Groq Key——解锁播客转文字
- P2:申请 Google/Bing API Key——补充中文搜索
- P2:注册企查查/天眼查 API——企业信息数据
7.3 核心洞察
这次审计最深刻的体会是:工具的丰富度不等于能力的完整性。
我们有 52 个工具、117 个 Skills、27 个 Plugins,但如果缺少向量数据库和数据管道,这些工具产出的数据就是孤岛——能抓、能存、但不能查、不能关联、不能分析。
真正的"信息获取能力"不是看你能连多少个平台,而是看你能否:
- 找到需要的信息(搜索 + 抓取)
- 理解信息的含义(NLP + 向量检索)
- 存储信息以备后用(数据库 + 版本管理)
- 关联不同来源的信息(知识图谱 + 交叉验证)
- 输出有价值的结论(报告生成 + 可视化)
前五步我们已经做得不错,第六步才是真正的分水岭。
参考来源
–全文完–

梦行志
