采集引擎
wescraft 的采集引擎支持从多种来源将内容汇入收集箱,统一管理信息输入。
采集来源
网页剪藏
通过浏览器扩展一键保存网页内容:
| 功能 | 说明 |
|---|---|
| 全页保存 | 保存完整网页内容 |
| 选区保存 | 只保存选中的部分 |
| 自动清洗 | 去除广告和干扰元素 |
| 元数据提取 | 标题、URL、时间 |
文件导入
支持多种文件格式:
- 文档:PDF、Word、Markdown、TXT
- 表格:Excel、CSV
- 图片:支持 OCR 提取文字
URL 抓取
capture_url 工具自动抓取指定网页:
| 步骤 | 说明 |
|---|---|
| 1 | 输入 URL |
| 2 | 自动抓取网页内容 |
| 3 | 清洗并格式化 |
| 4 | 存入收集箱 |
收集箱
工作流
所有采集的内容先进入收集箱:
来源 → 采集 → 收集箱 → 整理 → 页面/知识库
管理操作
| 操作 | 说明 |
|---|---|
| 查看 | 预览采集的内容 |
| 整理 | AI 辅助整理归类 |
| 转化 | 转为正式页面 |
| 删除 | 清理不需要的内容 |
AI 处理
自动分类
AI 自动分析采集内容的主题和类型:
- 文章 / 笔记 / 数据 / 参考资料
- 自动打标签
- 建议归属分类
内容摘要
对长文档自动生成摘要:
- 提取核心观点
- 识别关键数据
- 生成结构化摘要
知识提取
从采集内容中提取结构化知识:
- 关键信息提取
- 实体识别
- 关系建立
浏览器扩展
安装
扩展位于 extension/ 目录:
| 浏览器 | 支持 |
|---|---|
| Chrome | ✅ |
| Edge | ✅ |
| Firefox | ✅ |
功能
| 功能 | 说明 |
|---|---|
| 一键剪藏 | 保存当前页面 |
| 选区保存 | 保存选中内容 |
| 批注 | 添加个人注释 |
| 同步 | 自动同步到 wescraft |
与其他模块集成
知识库集成
采集的内容可以直接索引到知识库:
- 保留原始内容
- 建立语义索引
- 支持全文搜索
页面集成
采集内容可转化为正式页面:
- 自动格式转换
- 保留原始元数据
- 支持后续编辑
注意事项
- 采集内容归属当前 Cell
- 浏览器扩展需要配置连接地址
- 大文件采集可能需要较长时间
- 支持批量采集
- 采集历史可追溯