W3C 划出了一条常被产品页面模糊的界线:语音识别确定某人说了什么,而声纹识别确定说话的人是谁。
这种区别听起来很技术化,直到你选错工具。语音输入应用可以把你的句子转换成文字,却未必能验证这句话确实出自你本人。说话人验证系统可以通过声纹解锁账户,但可能根本不会生成可读的转录文本。两者都会听取音频,却解决不同的问题。
本指南将六个经常被当作同义词的术语区分开来:语音识别、声纹识别、语音转文字、听写、转录和语音控制。你可以先用对照表快速找到答案,再阅读与你的目标相符的章节。
核心要点
- 语音识别确定“说了什么”。声纹识别或说话人识别确定“是谁说的”。
- 语音转文字是许多语音识别系统产生的书面输出。
- 听写会把你说的话输入到正在使用的文本框中。转录通常处理录音或对话。
- 语音控制不止用于输入文字,还能让你操作按钮、菜单、窗口和其他界面元素。
- 日常写作时,应搜索听写或语音输入工具,而不是声纹识别工具。
六个术语速览
关于语音交互界面的术语来自多个领域:无障碍、电话通信、生物识别、语言学和消费软件。每个领域都形成了自己的标签,之后营销文案又把它们混在一起。下表为每个术语对应一种实际用途。
| 术语 | 回答的问题 | 典型结果 | 常见用途 |
|---|---|---|---|
| 语音识别 | 说了什么? | 文字或命令 | 听写、字幕、助手 |
| 声纹识别 | 谁在说话? | 身份或置信度评分 | 身份验证、说话人匹配 |
| 语音转文字 | 音频对应什么文字? | 转录文本 | 字幕、笔记、可搜索音频 |
| 听写或语音输入 | 光标处应出现什么文字? | 应用中的可编辑文字 | 电子邮件、文档、提示词 |
| 转录 | 这段音频中发生了什么? | 一份记录,通常包含说话人和时间戳 | 会议、访谈、录音 |
| 语音控制 | 计算机应该做什么? | 一项界面操作 | 导航和免动手操作 |
什么是语音识别?
语音识别是一种将口语转换成文字或将其解释为命令的技术。工程师通常称之为自动语音识别,简称 ASR。IBM 也将语音识别和语音转文字描述为密切相关的术语,因为文字是 ASR 系统最直观的输出。
它的核心任务属于语言层面。系统分析音频,推测其中的语音,并选择最符合这些语音及其上下文的词语。现代系统还可能添加字母大小写和标点。但它们仍可能在口音、人名、背景噪声、专业词汇和多语言混合语音上出错。
语音识别支撑着多种看似毫不相关的产品。实时字幕把演示内容变成可读文字。车载助手会把“打电话回家”解释为命令。语音键盘会把一段话插入电子邮件。界面和输出虽然不同,但每个系统都必须先弄清说话人说了什么。
W3C 语音识别概览将听写和计算机控制归入这个广义类别。该页面还指出,语音识别可以帮助肢体残障人士在不用键盘或鼠标的情况下使用计算机。准确率很重要,围绕识别器构建的命令、纠错工具和应用支持同样重要。
什么是声纹识别?
严格来说,声纹识别是指根据声音特征识别说话人。更精确的行业术语是“说话人识别”。它既可以从一组已登记人员中识别最可能的说话人,也可以验证说话人是否与其声称的身份相符。
核心任务是生物识别,而不是语言识别。系统会查找音高、节奏、声道特征和其他特点中的模式。它返回的结果可能是“此人很可能是账户所有者”,而不是一句话。系统可以进行说话人识别,而完全不关心句子的含义。
常见形式有两种:
- 说话人辨认判断正在说话的是哪位已知人员。
- 说话人验证判断声音是否与其声称的身份相符。
两种结果都不应被视为绝对可靠。录音、合成语音、疾病、衰老、嘈杂的房间和质量不佳的登记样本都可能影响声纹生物识别系统。对安全敏感的服务通常会把声音与其他信号结合起来,而不会将其视为神奇的身份证明。
日常语言则没那么严格。人们需要听写时,常会搜索“语音识别软件”;产品页面有时也会以同样方式使用这一说法。这种用法很常见,却掩盖了理解话语与识别说话人的区别。如果你的目标是写作,更有用的搜索词是语音转文字、语音输入或听写。
语音转文字的作用
语音转文字描述的是转换过程及其输出:输入音频,输出书面文字。它通常以语音识别技术为基础。Microsoft 的文档介绍了用于实时音频和批量录音的语音转文字服务,而 Google 则介绍了针对不同音频类型和流式处理需求优化的模型。
这个术语很少说明周边工作流。语音转文字引擎可能向开发者返回一个未格式化的字符串。字幕服务可能把该字符串拆成带时间信息的行。会议工具可能添加说话人标签。语音键盘可能整理句子并将其插入光标位置。识别器可能相似,产品体验却可能完全不同。
因此,仅凭宣传的准确率数字比较工具并不可靠。你还需要了解它能否处理你的语言、应用、标点、长录音、多位说话人、纠错、隐私,以及从开口说话到看到结果之间的延迟。我们的本地听写与云端听写指南介绍了这些取舍背后的一项重要架构选择。
听写与转录共用引擎,但工作流不同
听写通常是一个人有意进行的文字创作。你知道这些话本来就是要变成文字的。结果会实时出现,或在一小段话说完后出现,理想情况下直接出现在光标所在位置。你在写作过程中对其进行修改。
转录通常是为已经存在或独立发生的音频建立记录。音频可能包含多人、打断,以及需要忠实保留录音原貌的内容。实用的转录功能包括时间戳、说话人区分标注、回放链接和批量处理。
以团队会议为例。对着文档说“写一条简短更新,说明发布安排改到了星期五”,这是听写。上传 45 分钟录音并生成带说话人标签的记录,这是转录。再把记录变成简明更新,则是摘要。一个产品可能同时提供这三项功能,但它们是不同的任务。
Talkpad 专为听写场景而设计。在 macOS 和 Windows 上,将光标放到需要输入文字的应用中,按住一键通快捷键,说话,然后松开。输出的目标是成为可直接使用的文字,而不是存档用的转录记录。阅读一键通听写指南,了解这种工作流与持续监听工具在实际使用中的区别。
语音输入和听写几乎相同
语音输入是一个对消费者更友好的说法,指在文本框中进行听写。Microsoft 把通过 Win + H 开启的 Windows 功能称为“语音输入”。Apple 将其内置文字输入功能称为“听写”。Google Docs 将该功能称为“语音输入”。这些名称的差异大于其基本用途的差异。
桌面语音键盘还能增加一层功能。它可能跨多个应用工作,使用按住说话的热键,整理标点,并提供超出当前操作系统键盘范围的语言选择。重要的测试对象不是名称。把光标放进你真正用于工作的应用中,看看工具能否以可接受的准确率和延迟返回可编辑文字。
如果你刚开始使用 Windows,Windows 听写快捷键指南会介绍 Win + H、标点、语言切换,以及跨应用语音键盘何时可能更合适。
语音控制关注的是操作
语音控制让人能够操作界面:打开应用、点击有标签的控件、选择菜单项、滚动、选择文字或移动焦点。它通常包含听写功能,但文字输入只是系统的一部分。
Apple 清楚地呈现了这种区分。“听写”负责输入文字,“语音控制”提供更广泛的导航和编辑命令。Windows 同样提供用于文字输入的“语音输入”,以及通过语音操作 PC 的语音访问(Voice Access)。能舒适使用鼠标的人可能只需要听写;希望无需用手即可操作计算机的人则可能需要更广泛的命令系统。
这种区别在购买无障碍工具时很重要。快速生成转录文本并不能保证用户无需双手就能纠正错误、选择按钮或在应用之间切换。请测试完整任务,包括识别器听错命令后的恢复过程。
如何选择正确类别
从你需要的结果出发,再使用相应的搜索词。
- 你想在电子邮件、文档、聊天或 AI 工具中写作:选择听写或语音输入。
- 你想获得会议或录音的可搜索记录:选择转录。
- 你想在讲话过程中显示字幕:选择实时语音转文字或字幕工具。
- 你想用语音操作整台计算机:选择语音控制或语音访问(Voice Access)。
- 你想验证说话人是谁:选择说话人验证或声纹生物识别。
- 你正在开发产品:评估语音识别 API,再添加用户需要的工作流。
对于写作工具,请在重要的应用中做一个小测试。听写一个普通段落、一个问题、一个包含两个姓名的句子和一个专业术语。检查延迟、标点、整理工作量,以及文字是否落在正确位置。功能列表无法告诉你,你的语音输入结果需要多少修改。
常见购买误区
寻找声纹生物识别工具,却实际需要文字
专注于说话人验证的产品可能拥有出色的身份匹配能力,却没有实用的写作界面。应该改为搜索语音输入或听写工具。
为日常写作购买会议转录工具
会议工具围绕录音、参与者和摘要设计。当你只想在电子邮件中写三句话时,它们可能很别扭。应根据工作流选择,而不是追逐最亮眼的 AI 功能清单。
以为内置工具和跨应用工具可以互换
内置听写免费,而且可能已经够用。独立语音键盘可以提供不同的热键工作流、整理方式、语言支持或应用覆盖范围。付费前,请用同一段样本比较两者。
忽视纠错
第一版转录文本只是整个体验的一半。检查你能否快速撤销、编辑、重说,或切换到键盘输入精确字符串。姓名、数字、URL 和承诺内容始终值得复核。
常见问题
语音识别与语音转文字是一回事吗?
语音转文字是语音识别的一种常见应用和输出。语音识别也可以解释口头命令,而不生成可见的转录文本。
语音识别和声纹识别有什么区别?
语音识别确定某人说了什么。声纹识别或说话人识别则根据声音特征识别或验证说话的人。
听写使用的是语音识别还是声纹识别?
听写使用语音识别,通常配合语音转文字,将口语输入文档或文本框。它不需要识别说话人。
听写和转录有什么区别?
听写通常是一个人有意创作文字。转录则记录实时或已录制的音频,还可能添加时间戳、说话人标签和回放链接。
语音输入和语音控制有什么区别?
语音输入会在光标位置输入文字。语音控制还可以操作界面元素、浏览应用、选择文字,并通过语音执行计算机操作。
Talkpad 现已支持 macOS 和 Windows。使用量较大时,Pro 方案价格为每月 8 美元,或按年订阅每月 6 美元。免费下载 Talkpad – 免费方案每周可用 2,500 个单词。
