网页剪藏

WesCraft 提供浏览器扩展,支持一键将网页内容剪藏到收集箱中,是信息采集工作流的重要入口。


浏览器扩展安装

安装方式

  1. 打开 WesCraft 设置页面
  2. 进入「扩展 → 浏览器扩展」
  3. 下载对应浏览器的扩展包
  4. 安装到 Chrome / Edge / Firefox

连接配置

安装后需要将扩展与本地运行的 WesCraft 关联:

  1. 点击浏览器工具栏中的 WesCraft 图标
  2. 输入本地服务地址(默认 http://localhost:3100)
  3. 验证连接成功

注意:浏览器扩展通过本地 HTTP 与 WesCraft 通信,无需云端中转。


网页内容抓取

快速剪藏

在任意网页上:

  1. 点击工具栏中的 WesCraft 图标
  2. 选择「剪藏整页」或「剪藏选中内容」
  3. 内容自动发送到收集箱

选择性剪藏

右键菜单

在网页上右键即可看到 WesCraft 剪藏选项:


多格式采集

浏览器扩展支持采集多种格式的内容:

格式说明
文字自动清理 HTML 标签,保留格式结构
图片下载图片到本地,保存在 Cell 的 workspace 目录
链接保存原始 URL,支持后续深度提取
表格保持表格结构,可转为数据库表
代码块识别并保留代码高亮和语言标注

采集到收集箱的流程

网页 → 浏览器扩展 → WesCraft 本地服务 → 收集箱(Inbox)
  1. 扩展端:解析网页内容,提取结构化数据
  2. 传输:通过本地 HTTP 发送到 WesCraft 后端
  3. 入库:内容以采集条目形式进入收集箱
  4. 通知:WesCraft 侧边栏收集箱图标显示新条目数量

采集的内容归属当前活跃的 Cell。


采集内容的后续处理

内容进入收集箱后,你可以:

手动处理

AI 辅助处理

知识库索引

采集的内容可以导入到知识库,经过文件智能引擎的处理后支持语义搜索。


使用技巧

  1. 快捷键:设置浏览器扩展快捷键,实现一键剪藏
  2. 批量采集:打开多个标签页后,使用「批量剪藏所有标签页」功能
  3. 定期整理:养成每日清理收集箱的习惯,将内容分类到合适的页面

相关文档