网页剪藏
WesCraft 提供浏览器扩展,支持一键将网页内容剪藏到收集箱中,是信息采集工作流的重要入口。
浏览器扩展安装
安装方式
- 打开 WesCraft 设置页面
- 进入「扩展 → 浏览器扩展」
- 下载对应浏览器的扩展包
- 安装到 Chrome / Edge / Firefox
连接配置
安装后需要将扩展与本地运行的 WesCraft 关联:
- 点击浏览器工具栏中的 WesCraft 图标
- 输入本地服务地址(默认
http://localhost:3100) - 验证连接成功
注意:浏览器扩展通过本地 HTTP 与 WesCraft 通信,无需云端中转。
网页内容抓取
快速剪藏
在任意网页上:
- 点击工具栏中的 WesCraft 图标
- 选择「剪藏整页」或「剪藏选中内容」
- 内容自动发送到收集箱
选择性剪藏
- 整页剪藏:抓取页面标题、正文、图片和链接
- 选中剪藏:仅抓取鼠标选中的文字和图片
- 链接剪藏:只保存 URL 和标题,后续由 AI 提取内容
右键菜单
在网页上右键即可看到 WesCraft 剪藏选项:
- 剪藏当前页面
- 剪藏选中内容
- 剪藏链接
- 剪藏图片
多格式采集
浏览器扩展支持采集多种格式的内容:
| 格式 | 说明 |
|---|---|
| 文字 | 自动清理 HTML 标签,保留格式结构 |
| 图片 | 下载图片到本地,保存在 Cell 的 workspace 目录 |
| 链接 | 保存原始 URL,支持后续深度提取 |
| 表格 | 保持表格结构,可转为数据库表 |
| 代码块 | 识别并保留代码高亮和语言标注 |
采集到收集箱的流程
网页 → 浏览器扩展 → WesCraft 本地服务 → 收集箱(Inbox)
- 扩展端:解析网页内容,提取结构化数据
- 传输:通过本地 HTTP 发送到 WesCraft 后端
- 入库:内容以采集条目形式进入收集箱
- 通知:WesCraft 侧边栏收集箱图标显示新条目数量
采集的内容归属当前活跃的 Cell。
采集内容的后续处理
内容进入收集箱后,你可以:
手动处理
- 转为页面:将采集内容创建为独立页面
- 合并到页面:将内容追加到已有页面
- 添加标签:为采集内容打标签,便于分类
- 删除:清理不需要的内容
AI 辅助处理
- 让 AI 自动总结采集内容
- AI 根据内容自动建议分类和标签
- 批量处理多条采集内容
知识库索引
采集的内容可以导入到知识库,经过文件智能引擎的处理后支持语义搜索。
使用技巧
- 快捷键:设置浏览器扩展快捷键,实现一键剪藏
- 批量采集:打开多个标签页后,使用「批量剪藏所有标签页」功能
- 定期整理:养成每日清理收集箱的习惯,将内容分类到合适的页面
相关文档
- 收集箱 →
inbox.md - 采集引擎 →
capture-engine.md - 知识库 →
knowledge.md - 扩展 →
extension.md