语音输入
Wesclaw 支持语音输入功能,让你可以通过语音与 AI 助手对话,无需手动打字。无论是快速提问、口述长文还是在手忙脚乱时发出指令,语音输入都能显著提升你的使用效率。
功能概述
语音输入基于 Whisper 语音转文字引擎,能够将你的语音实时转换为文字,并作为对话消息发送给 AI 助手。
主要特性:
- 高精度识别:基于 OpenAI Whisper 模型,识别准确率高
- 多语言支持:支持中文、英文及数十种语言
- 本地处理:语音转写可在本地完成,保护隐私
- 实时反馈:边说边转写,即时看到识别结果
支持的语言
Wesclaw 的语音识别支持以下主要语言:
| 语言 | 识别质量 | 说明 |
|---|---|---|
| 中文(普通话) | ⭐⭐⭐⭐⭐ | 完整支持,含方言优化 |
| 英语 | ⭐⭐⭐⭐⭐ | 完整支持 |
| 日语 | ⭐⭐⭐⭐ | 良好支持 |
| 韩语 | ⭐⭐⭐⭐ | 良好支持 |
| 法语 | ⭐⭐⭐⭐ | 良好支持 |
| 德语 | ⭐⭐⭐⭐ | 良好支持 |
| 西班牙语 | ⭐⭐⭐⭐ | 良好支持 |
提示:语音识别会自动检测语言,你也可以在设置中指定首选语言以提高识别准确度。
配置方法
桌面版配置
- 打开 Wesclaw 桌面应用
- 进入 设置 → 语音输入
- 配置以下选项:
# config.yaml 语音相关配置
stt:
enabled: true
language: "zh" # 首选识别语言
model: "whisper-large" # 使用的 Whisper 模型
vad_enabled: true # 语音活动检测(自动开始/停止)
麦克风权限
首次使用语音输入时,系统会请求麦克风权限:
- macOS:在 系统设置 → 隐私与安全性 → 麦克风 中授权
- Windows:在 设置 → 隐私 → 麦克风 中授权
- Linux:确保 PulseAudio 或 PipeWire 正常运行
快捷键设置
默认语音输入快捷键:
| 操作 | 快捷键 |
|---|---|
| 开始/停止录音 | Ctrl + Shift + V(macOS: ⌘ + Shift + V) |
| 取消录音 | Esc |
使用方法
基本使用
- 在对话输入框旁点击 🎤 麦克风按钮,或使用快捷键
- 看到录音指示器亮起后开始说话
- 说完后再次点击按钮或按快捷键停止
- 转写的文字会自动填入输入框
- 确认无误后按 Enter 发送
语音活动检测(VAD)
开启 VAD 后,系统会自动检测你何时开始说话、何时停顿:
- 检测到静音超过 2 秒自动停止录音
- 无需手动点击停止按钮
- 适合短句、快速指令场景
长文口述
如果你需要口述较长的内容:
- 关闭 VAD 功能(避免因停顿被中断)
- 点击麦克风按钮开始录音
- 持续说话,可以适当停顿
- 说完所有内容后手动点击停止
- 检查转写结果并编辑后发送
使用场景
场景一:快速提问
在你手头忙碌时,直接语音提问:
"帮我查一下明天北京的天气怎么样"
AI 助手会将语音转为文字后正常回复。
场景二:口述邮件
需要撰写一封邮件时:
"帮我写一封邮件给张总,内容是关于下周三的项目评审会议,时间改到下午两点,地点在三楼会议室,请他提前准备好项目进度报告"
场景三:翻译辅助
对着 AI 说中文,让它翻译为英文:
"请把下面这段话翻译成英文:我们公司计划在下个季度推出新产品"
场景四:会议记录整理
将会议录音要点口述给 AI 整理:
"今天会议讨论了三个议题,第一是产品上线时间确定为十月一号,第二是市场推广预算增加百分之二十,第三是招聘两名前端开发工程师"
注意事项
环境要求
- 安静环境:嘈杂环境会影响识别准确度
- 麦克风质量:建议使用专用麦克风或耳机麦克风
- 网络连接:如使用云端 Whisper 模型,需要稳定网络
隐私安全
- 本地模式下,语音数据不会离开你的设备
- 云端模式下,音频数据仅用于转写,不会被存储
- 转写后的音频数据会立即从内存中清除
已知限制
- 方言识别准确度可能低于普通话
- 专业术语可能需要后续手动修正
- 极短语音(不到 1 秒)可能无法正确识别
- 多人同时说话的场景识别效果较差
最佳实践
- 语速适中:不要太快或太慢,保持自然语速
- 吐字清晰:尽量清晰发音,尤其是专业术语
- 分段输入:长内容建议分段口述,便于检查和修正
- 即时确认:发送前养成检查转写结果的习惯
常见问题
Q: 语音识别不准确怎么办?
A: 尝试以下方法:
- 切换到更安静的环境
- 在设置中指定首选语言
- 尝试使用更大的 Whisper 模型(如 large-v3)
- 放慢语速,清晰发音
Q: 点击麦克风按钮没有反应?
A: 请检查:
- 是否已授予麦克风权限
- 麦克风设备是否正常连接
- 音频驱动是否正常工作
Q: 可以同时使用语音和文字输入吗?
A: 可以。你可以先用语音输入一部分内容,然后在输入框中手动编辑补充,再一起发送。