Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

109 Commits
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

OneFetch

语言 / Language: 中文 | English

OneFetch 是一个面向 agent 的网页读取 skill,支持:

  • 小红书(笔记 + 可选评论)
  • 微信公众号文章
  • 知乎(专栏文章 + 问答)
  • B 站(视频字幕提取 + 专栏文章)
  • 通用网页(含 SPA / JS 渲染页面)

默认用于快速阅读:抓取去噪后的正文并交给大模型归纳总结。

下载到本地

git clone https://github.com/HuaxinLab/onefetch.git
cd onefetch

工具作用

  • 给 agent 提供统一网页读取能力(而不是依赖不稳定的临时抓取)。
  • 返回去噪正文,适合大模型做总结、翻译和深度整理。
  • 默认优先复用缓存,避免重复抓取。

安装到 Agent(推荐)

普通用户不需要自己执行抓取脚本,只需把 skill 安装给 agent 即可。

示例(Claude Code):

ln -s /path/to/onefetch ~/.claude/skills/onefetch

安装后直接对 agent 说:

  • "读取这个网页:"
  • "总结这条公众号内容"
  • "抓这个小红书并输出要点"

支持的平台

平台 你可以这样说
小红书 "读取这条小红书笔记:"
微信公众号 "总结这篇公众号文章:"
知乎 "读一下这篇知乎专栏:"、"总结这个知乎问答:"
B 站 "总结这个 B 站视频:"、"读取这篇 B 站专栏:"
其他网页 "读取这个网页并总结 3 点:"

对于 SPA / 纯 JS 渲染的页面(如 React/Vue/Next.js 站点),OneFetch 会自动尝试浏览器渲染。首次使用时 agent 会自动安装所需的浏览器组件。

常见场景

场景 1:先快速看内容

"读取这个网页并总结 3 点:"

场景 2:内容有价值,想保存

"把这篇内容整理后保存。"

场景 2b:保存文章连同图片

"把这篇文章连图片一起保存。"

场景 3:保存后发现文件里没有摘要/要点/标签

"用刚才保存的正文补充整理摘要和标签。"(不需要重新抓取 URL)

场景 4:想看最新内容

"这篇文章先刷新最新内容,再重新整理并保存:"

场景 5:需要小红书评论

"抓取这条小红书笔记,包括评论:"

首次使用评论功能时,agent 会引导你配置一次 Cookie。

场景 6:知乎专栏需要 Cookie

知乎问答和回答页面无需 Cookie 可直接读取。知乎专栏文章需要 Cookie,agent 会提示你配置一次即可。

场景 7:提取/下载页面中的图片

"下载这个帖子的图片"、"提取这个页面的图片链接"

场景 8:图文一起分析

"帮我分析这篇文章的图文内容"(agent 会把文字和图片一起交给多模态模型)

场景 9:需要登录才能查看的网站

"这个网站需要登录才能看,帮我配置一下 Cookie。"

agent 会引导你配置该网站的 Cookie,之后访问该网站会自动带上登录态。

场景 10:给一个目录页,批量抓完整内容

"这个课程目录页帮我按章节全部抓取并保存:<入口URL>"

agent 会先发现内容页 URL,再批量抓取并保存成一个合集目录。

Cookie 配置方法

部分平台和需要登录的网站需要一次性配置 Cookie(B 站视频字幕、知乎专栏、小红书评论等):

  1. 在浏览器中登录对应平台
  2. 获取 Cookie(任选一种方式):
    • F12 开发者工具:Network → 点击任意请求 → Headers → 复制 Cookie: 的值
    • 浏览器插件:Cookie-Editor(导出选 Header String)、Get cookies.txt 等
  3. 复制后直接运行配置脚本(自动读取剪贴板,按 Enter 确认即可)
    • 示例:bash scripts/setup_cookie.sh zhihu.comxiaohongshu.combilibili.com
    • 任意网站:bash scripts/setup_cookie.sh example.com(填域名即可)

注意:Cookie 格式必须是 Header String(key=value; key=value; ...)。 该脚本会保存到本地加密存储(.onefetch/secrets.db),不再写入 .secrets 明文文件。

页面元素提取(Plugin)

除了读取整篇文章,你还可以让 agent 从页面中提取特定内容。不需要填写技术参数,直接描述目标即可:

  • "帮我拿这个页面里下载按钮的链接:"
  • "这个页面里有动态图片,帮我提取最终图片 URL:"
  • "这个接口返回里我要 img_url 字段,帮我拿到:"

如果提取失败,agent 会返回失败原因和下一步建议。

遇到问题?

大多数情况下 agent 会自动处理。如果遇到依赖缺失或环境异常,agent 会给出具体的修复命令,按提示操作即可。

可选扩展能力

部分站点会有更高质量的专用解析(adapter/expander),由独立扩展仓库维护。
普通用户不需要关心命令细节,只需告诉 agent 你的目标;agent 会按需查看扩展仓库并完成安装/更新。

扩展仓库:

文档

  • 本页即普通用户使用说明。
  • 开发者 / 专业用户请查看:文档索引

About

Skill-first web content fetcher for agents: Xiaohongshu, WeChat Official Accounts, and generic HTML (fetch-first, optional store).

Resources

Stars

0 stars

Watchers

0 watching

Forks

Contributors

Languages