语音输入

Wesclaw 支持语音输入功能,让你可以通过语音与 AI 助手对话,无需手动打字。无论是快速提问、口述长文还是在手忙脚乱时发出指令,语音输入都能显著提升你的使用效率。


功能概述

语音输入基于 Whisper 语音转文字引擎,能够将你的语音实时转换为文字,并作为对话消息发送给 AI 助手。

主要特性:


支持的语言

Wesclaw 的语音识别支持以下主要语言:

语言识别质量说明
中文(普通话)⭐⭐⭐⭐⭐完整支持,含方言优化
英语⭐⭐⭐⭐⭐完整支持
日语⭐⭐⭐⭐良好支持
韩语⭐⭐⭐⭐良好支持
法语⭐⭐⭐⭐良好支持
德语⭐⭐⭐⭐良好支持
西班牙语⭐⭐⭐⭐良好支持

提示:语音识别会自动检测语言,你也可以在设置中指定首选语言以提高识别准确度。


配置方法

桌面版配置

  1. 打开 Wesclaw 桌面应用
  2. 进入 设置 → 语音输入
  3. 配置以下选项:
# config.yaml 语音相关配置
stt:
  enabled: true
  language: "zh"          # 首选识别语言
  model: "whisper-large"  # 使用的 Whisper 模型
  vad_enabled: true       # 语音活动检测(自动开始/停止)

麦克风权限

首次使用语音输入时,系统会请求麦克风权限:

快捷键设置

默认语音输入快捷键:

操作快捷键
开始/停止录音Ctrl + Shift + V(macOS: ⌘ + Shift + V)
取消录音Esc

使用方法

基本使用

  1. 在对话输入框旁点击 🎤 麦克风按钮,或使用快捷键
  2. 看到录音指示器亮起后开始说话
  3. 说完后再次点击按钮或按快捷键停止
  4. 转写的文字会自动填入输入框
  5. 确认无误后按 Enter 发送

语音活动检测(VAD)

开启 VAD 后,系统会自动检测你何时开始说话、何时停顿:

长文口述

如果你需要口述较长的内容:

  1. 关闭 VAD 功能(避免因停顿被中断)
  2. 点击麦克风按钮开始录音
  3. 持续说话,可以适当停顿
  4. 说完所有内容后手动点击停止
  5. 检查转写结果并编辑后发送

使用场景

场景一:快速提问

在你手头忙碌时,直接语音提问:

"帮我查一下明天北京的天气怎么样"

AI 助手会将语音转为文字后正常回复。

场景二:口述邮件

需要撰写一封邮件时:

"帮我写一封邮件给张总,内容是关于下周三的项目评审会议,时间改到下午两点,地点在三楼会议室,请他提前准备好项目进度报告"

场景三:翻译辅助

对着 AI 说中文,让它翻译为英文:

"请把下面这段话翻译成英文:我们公司计划在下个季度推出新产品"

场景四:会议记录整理

将会议录音要点口述给 AI 整理:

"今天会议讨论了三个议题,第一是产品上线时间确定为十月一号,第二是市场推广预算增加百分之二十,第三是招聘两名前端开发工程师"


注意事项

环境要求

隐私安全

已知限制

最佳实践

  1. 语速适中:不要太快或太慢,保持自然语速
  2. 吐字清晰:尽量清晰发音,尤其是专业术语
  3. 分段输入:长内容建议分段口述,便于检查和修正
  4. 即时确认:发送前养成检查转写结果的习惯

常见问题

Q: 语音识别不准确怎么办?

A: 尝试以下方法:

Q: 点击麦克风按钮没有反应?

A: 请检查:

Q: 可以同时使用语音和文字输入吗?

A: 可以。你可以先用语音输入一部分内容,然后在输入框中手动编辑补充,再一起发送。