W3C vạch ra một ranh giới mà phần lớn các trang sản phẩm thường làm mờ: nhận dạng lời nói xác định những từ một người nói ra, còn nhận dạng giọng nói xác định người đang nói.
Sự khác biệt đó nghe có vẻ kỹ thuật cho đến khi bạn chọn nhầm công cụ. Một ứng dụng nhập liệu bằng giọng nói có thể chuyển câu bạn nói thành văn bản, nhưng không nhất thiết xác minh được câu đó do chính bạn nói. Một hệ thống xác minh người nói có thể mở khóa tài khoản dựa trên mẫu giọng của bạn, nhưng có thể không bao giờ tạo ra bản chép lời dễ đọc. Cả hai đều nghe âm thanh. Chúng giải quyết những vấn đề khác nhau.
Hướng dẫn này phân biệt sáu thuật ngữ thường bị xem là đồng nghĩa: nhận dạng lời nói, nhận dạng giọng nói, chuyển lời nói thành văn bản, đọc chính tả, chép lời và điều khiển bằng giọng nói. Hãy dùng bảng so sánh để xem câu trả lời nhanh, rồi đọc những phần phù hợp với việc bạn muốn làm.
Những điểm chính
- Nhận dạng lời nói xác định nội dung đã được nói. Nhận dạng giọng nói hoặc nhận dạng người nói xác định ai đã nói.
- Chuyển lời nói thành văn bản là đầu ra dạng chữ do nhiều hệ thống nhận dạng lời nói tạo ra.
- Đọc chính tả đưa lời bạn nói vào trường văn bản nơi bạn đang làm việc. Việc chép lời thường xử lý một bản ghi âm hoặc cuộc trò chuyện.
- Điều khiển bằng giọng nói không chỉ nhập văn bản mà còn cho phép bạn thao tác với các nút, trình đơn, cửa sổ và những thành phần giao diện khác.
- Đối với công việc viết lách hằng ngày, hãy tìm công cụ đọc chính tả hoặc nhập liệu bằng giọng nói thay vì nhận dạng giọng nói.
Tổng quan nhanh về sáu thuật ngữ
Các thuật ngữ về giao diện bằng giọng nói bắt nguồn từ nhiều lĩnh vực: trợ năng, điện thoại, sinh trắc học, ngôn ngữ học và phần mềm tiêu dùng. Mỗi lĩnh vực phát triển hệ thống tên gọi riêng. Sau đó, nội dung tiếp thị trộn lẫn chúng với nhau. Bảng này gắn mỗi thuật ngữ với một nhiệm vụ thực tế.
| Thuật ngữ | Câu hỏi được trả lời | Kết quả điển hình | Cách dùng phổ biến |
|---|---|---|---|
| Nhận dạng lời nói | Nội dung được nói là gì? | Từ ngữ hoặc lệnh | Đọc chính tả, phụ đề, trợ lý |
| Nhận dạng giọng nói | Ai đang nói? | Danh tính hoặc điểm tin cậy | Xác thực, đối chiếu người nói |
| Chuyển lời nói thành văn bản | Văn bản nào tương ứng với âm thanh? | Bản chép lời | Phụ đề, ghi chú, âm thanh có thể tìm kiếm |
| Đọc chính tả hoặc nhập liệu bằng giọng nói | Văn bản nào sẽ xuất hiện tại con trỏ? | Văn bản có thể chỉnh sửa trong ứng dụng | Email, tài liệu, lời nhắc |
| Chép lời | Điều gì đã diễn ra trong đoạn âm thanh này? | Một bản ghi, thường có nhãn người nói và dấu thời gian | Cuộc họp, phỏng vấn, bản ghi âm |
| Điều khiển bằng giọng nói | Máy tính nên làm gì? | Một thao tác trên giao diện | Điều hướng và thao tác rảnh tay |
Nhận dạng lời nói là gì?
Nhận dạng lời nói là công nghệ chuyển ngôn ngữ nói thành từ ngữ hoặc diễn giải lời nói như một lệnh. Các kỹ sư thường gọi công nghệ này là nhận dạng lời nói tự động, viết tắt là ASR. IBM cũng mô tả nhận dạng lời nói và chuyển lời nói thành văn bản là hai thuật ngữ có quan hệ chặt chẽ vì văn bản là đầu ra dễ thấy nhất của một hệ thống ASR.
Nhiệm vụ cốt lõi thuộc về ngôn ngữ. Hệ thống phân tích âm thanh, ước tính các âm và chọn những từ phù hợp nhất với các âm đó cùng ngữ cảnh. Các hệ thống hiện đại còn có thể thêm chữ hoa và dấu câu. Chúng vẫn có thể mắc lỗi với chất giọng, tên riêng, tiếng ồn nền, từ vựng chuyên ngành và lời nói pha trộn nhiều ngôn ngữ.
Nhận dạng lời nói vận hành nhiều sản phẩm trông có vẻ không liên quan. Phụ đề trực tiếp biến một bài thuyết trình thành văn bản có thể đọc được. Trợ lý trên ô tô diễn giải câu "gọi về nhà" như một lệnh. Bàn phím giọng nói chèn một đoạn văn vào email. Giao diện và đầu ra khác nhau, nhưng mỗi hệ thống trước tiên đều phải xác định người nói đã nói gì.
Tổng quan về nhận dạng lời nói của W3C xếp việc đọc chính tả và điều khiển máy tính vào nhóm rộng này. Nội dung này cũng lưu ý rằng nhận dạng lời nói có thể giúp người khuyết tật vận động sử dụng máy tính mà không cần bàn phím hoặc chuột. Độ chính xác rất quan trọng, nhưng các lệnh, công cụ sửa lỗi và khả năng hỗ trợ ứng dụng được xây dựng quanh bộ nhận dạng cũng quan trọng không kém.
Nhận dạng giọng nói là gì?
Khi được dùng theo nghĩa nghiêm ngặt, nhận dạng giọng nói là nhận ra một người nói dựa trên các đặc điểm trong giọng của họ. Thuật ngữ chính xác hơn trong ngành là nhận dạng người nói. Công nghệ này có thể xác định người có khả năng đang nói từ một nhóm người đã đăng ký hoặc xác minh xem người nói có khớp với danh tính mà họ khai báo hay không.
Nhiệm vụ cốt lõi là sinh trắc học chứ không phải ngôn ngữ. Hệ thống tìm kiếm các mẫu về cao độ, nhịp điệu, đặc điểm đường thanh âm và những đặc trưng khác. Kết quả có thể là "đây nhiều khả năng là chủ tài khoản" thay vì một câu văn. Hệ thống có thể nhận dạng người nói mà không cần quan tâm câu đó có nghĩa gì.
Có hai hình thức phổ biến:
- Xác định người nói hỏi xem ai trong số những người đã biết đang nói.
- Xác minh người nói hỏi xem giọng nói có khớp với người mà họ tự nhận hay không.
Không nên xem bất kỳ kết quả nào là tuyệt đối chính xác. Bản ghi âm, giọng nói tổng hợp, bệnh tật, lão hóa, phòng ồn và mẫu đăng ký kém chất lượng đều có thể ảnh hưởng đến hệ thống sinh trắc học giọng nói. Các dịch vụ nhạy cảm về bảo mật thường kết hợp giọng nói với những tín hiệu khác thay vì coi đó là bằng chứng xác thực danh tính tuyệt đối.
Trong cách nói hằng ngày, ranh giới này lỏng hơn. Mọi người tìm kiếm "phần mềm nhận dạng giọng nói" khi thực ra họ muốn đọc chính tả. Các trang sản phẩm đôi khi cũng dùng cụm từ theo cách đó. Cách dùng này phổ biến, nhưng nó che khuất khác biệt giữa việc hiểu từ ngữ và xác định người nói. Nếu mục tiêu của bạn là viết, các cụm từ tìm kiếm hữu ích là chuyển lời nói thành văn bản, nhập liệu bằng giọng nói hoặc đọc chính tả.
Chuyển lời nói thành văn bản nằm ở đâu
Chuyển lời nói thành văn bản mô tả quá trình chuyển đổi và đầu ra của nó: âm thanh đi vào, chữ viết đi ra. Công nghệ này thường được vận hành bằng nhận dạng lời nói. Microsoft có tài liệu về các dịch vụ chuyển lời nói thành văn bản cho âm thanh thời gian thực và bản ghi xử lý theo lô, còn Google mô tả các mô hình được tinh chỉnh cho nhiều loại âm thanh và nhu cầu phát trực tuyến khác nhau.
Thuật ngữ này cho biết ít hơn về quy trình làm việc xung quanh. Một hệ thống chuyển lời nói thành văn bản có thể trả về chuỗi chưa định dạng cho nhà phát triển. Dịch vụ tạo phụ đề có thể chia chuỗi đó thành các dòng được căn thời gian. Công cụ họp có thể thêm nhãn người nói. Bàn phím giọng nói có thể làm gọn câu và chèn nó tại con trỏ. Bộ nhận dạng có thể tương tự nhau trong khi trải nghiệm sản phẩm hoàn toàn khác biệt.
Đó là lý do việc chỉ so sánh công cụ theo con số độ chính xác được quảng cáo là chưa đủ. Bạn còn cần biết công cụ có xử lý được ngôn ngữ, ứng dụng, dấu câu, bản ghi dài, nhiều người nói và thao tác sửa lỗi của bạn hay không; nó bảo vệ quyền riêng tư thế nào; và độ trễ từ lúc nói đến khi thấy kết quả là bao lâu. Hướng dẫn của chúng tôi về đọc chính tả cục bộ và trên đám mây giải thích một lựa chọn kiến trúc quan trọng đằng sau những đánh đổi đó.
Đọc chính tả và chép lời dùng chung bộ máy xử lý, nhưng khác quy trình làm việc
Đọc chính tả thường là việc một người chủ ý soạn nội dung. Bạn biết những lời mình nói sẽ được chuyển thành văn bản. Kết quả xuất hiện trực tiếp hoặc sau một đoạn nói ngắn, lý tưởng nhất là ngay tại nơi con trỏ đang nằm. Bạn sửa kết quả trong quá trình viết.
Chép lời thường tạo một bản ghi từ âm thanh đã tồn tại hoặc đang diễn ra độc lập. Âm thanh có thể gồm nhiều người, những lần ngắt lời và nội dung cần giữ nguyên theo bản ghi. Các tính năng chép lời hữu ích bao gồm dấu thời gian, phân tách người nói, liên kết phát lại và xử lý theo lô.
Hãy xem xét một cuộc họp nhóm. Nói "Viết một thông báo ngắn rằng ngày ra mắt đã chuyển sang thứ Sáu" vào tài liệu là đọc chính tả. Tải bản ghi dài 45 phút lên và tạo bản ghi có nhãn người nói là chép lời. Biến bản ghi đó thành một thông báo súc tích là tóm tắt. Một sản phẩm có thể cung cấp cả ba, nhưng đó là ba công việc riêng biệt.
Talkpad được thiết kế cho phía đọc chính tả. Trên macOS và Windows, bạn đặt con trỏ trong ứng dụng nơi muốn nhập văn bản, giữ phím tắt nhấn để nói, nói rồi thả ra. Đầu ra được thiết kế để trở thành nội dung phục vụ công việc chứ không phải bản chép lời để lưu trữ. Hãy đọc hướng dẫn đọc chính tả kiểu nhấn để nói để hiểu khác biệt thực tế giữa quy trình đó và các công cụ luôn lắng nghe.
Nhập liệu bằng giọng nói và đọc chính tả gần như giống nhau
Nhập liệu bằng giọng nói là cách gọi thân thiện hơn với người dùng phổ thông cho việc đọc chính tả vào một trường văn bản. Microsoft dùng tên "nhập liệu bằng giọng nói" cho tính năng Windows mở bằng Win + H. Apple gọi tính năng nhập văn bản tích hợp của mình là Đọc chính tả. Google Docs gọi tính năng của mình là Nhập liệu bằng giọng nói. Tên gọi khác nhau nhiều hơn nhiệm vụ cơ bản.
Bàn phím giọng nói trên máy tính có thể bổ sung thêm một lớp. Nó có thể hoạt động trong nhiều ứng dụng, dùng phím nóng giữ để nói, chỉnh dấu câu và cung cấp các lựa chọn ngôn ngữ ngoài bàn phím hệ điều hành đang hoạt động. Điều quan trọng cần kiểm tra không phải là nhãn tên. Hãy đặt con trỏ trong ứng dụng làm việc thực tế của bạn và xem công cụ có trả về văn bản chỉnh sửa được với độ chính xác và độ trễ chấp nhận được hay không.
Nếu bạn mới dùng Windows, hướng dẫn các phím tắt đọc chính tả trên Windows trình bày Win + H, dấu câu, chuyển đổi ngôn ngữ và những trường hợp bàn phím giọng nói hoạt động trên nhiều ứng dụng có thể phù hợp hơn.
Điều khiển bằng giọng nói tập trung vào thao tác
Điều khiển bằng giọng nói cho phép một người vận hành giao diện: mở ứng dụng, bấm một nút điều khiển có nhãn, chọn mục trong trình đơn, cuộn, chọn văn bản hoặc chuyển tiêu điểm. Hệ thống thường bao gồm đọc chính tả, nhưng nhập văn bản chỉ là một phần.
Apple thể hiện rõ sự phân tách này. Đọc chính tả dùng để nhập văn bản. Điều khiển bằng giọng nói cung cấp các lệnh điều hướng và chỉnh sửa rộng hơn. Tương tự, Windows cung cấp nhập liệu bằng giọng nói để nhập văn bản và Truy cập bằng giọng nói để vận hành PC bằng lời nói. Người có thể thoải mái dùng chuột có thể chỉ cần đọc chính tả. Người muốn sử dụng máy tính mà không cần dùng tay có thể cần hệ thống lệnh rộng hơn.
Sự khác biệt này rất quan trọng khi mua công cụ trợ năng. Một bản chép lời nhanh không đảm bảo rằng người dùng có thể sửa lỗi, chọn nút hoặc chuyển giữa các ứng dụng mà không dùng tay. Hãy kiểm tra toàn bộ nhiệm vụ, bao gồm cả cách khắc phục khi bộ nhận dạng nghe nhầm lệnh.
Cách chọn đúng nhóm công cụ
Hãy bắt đầu từ kết quả bạn cần, sau đó dùng cụm từ tìm kiếm tương ứng.
- Bạn muốn viết trong email, tài liệu, ứng dụng trò chuyện hoặc công cụ AI: hãy chọn đọc chính tả hoặc nhập liệu bằng giọng nói.
- Bạn muốn có bản ghi có thể tìm kiếm của một cuộc họp hoặc bản ghi âm: hãy chọn chép lời.
- Bạn muốn có phụ đề trong lúc có người nói: hãy chọn chuyển lời nói thành văn bản trực tiếp hoặc tạo phụ đề.
- Bạn muốn vận hành toàn bộ máy tính bằng lời nói: hãy chọn điều khiển bằng giọng nói hoặc Truy cập bằng giọng nói.
- Bạn muốn xác minh ai đang nói: hãy chọn xác minh người nói hoặc sinh trắc học giọng nói.
- Bạn đang xây dựng một sản phẩm: hãy đánh giá một API nhận dạng lời nói, sau đó bổ sung quy trình mà người dùng của bạn cần.
Đối với công cụ viết, hãy thực hiện một bài kiểm tra nhỏ trong những ứng dụng quan trọng. Đọc chính tả một đoạn văn thông thường, một câu hỏi, một câu có hai tên riêng và một thuật ngữ chuyên ngành. Kiểm tra độ trễ, dấu câu, công sức chỉnh sửa và văn bản có xuất hiện đúng chỗ không. Danh sách tính năng không thể cho bạn biết lời nói của chính mình sẽ cần sửa nhiều đến đâu.
Những sai lầm thường gặp khi mua
Mua công cụ sinh trắc học giọng nói khi bạn cần văn bản
Một sản phẩm tập trung vào xác minh người nói có thể đối chiếu danh tính rất tốt nhưng không có giao diện viết hữu ích. Thay vào đó, hãy tìm công cụ nhập liệu bằng giọng nói hoặc đọc chính tả.
Mua công cụ chép lời cuộc họp để viết hằng ngày
Công cụ họp được thiết kế xoay quanh bản ghi âm, người tham gia và bản tóm tắt. Chúng có thể bất tiện khi bạn chỉ muốn viết ba câu trong một email. Hãy chọn quy trình phù hợp, không phải danh sách tính năng AI ấn tượng nhất.
Cho rằng công cụ tích hợp sẵn và công cụ đa ứng dụng có thể thay thế nhau
Tính năng đọc chính tả tích hợp sẵn là miễn phí và có thể đã đủ. Một bàn phím giọng nói riêng có thể cung cấp quy trình phím nóng, cách làm gọn văn bản, hỗ trợ ngôn ngữ hoặc phạm vi ứng dụng khác. Hãy so sánh cả hai bằng cùng một mẫu trước khi trả phí.
Bỏ qua việc sửa lỗi
Bản chép lời đầu tiên chỉ là một nửa trải nghiệm. Hãy kiểm tra xem bạn có thể hoàn tác, chỉnh sửa, lặp lại hoặc chuyển sang bàn phím để nhập chính xác các chuỗi ký tự nhanh đến mức nào. Tên riêng, số, URL và cam kết luôn cần được kiểm tra.
Câu hỏi thường gặp
Nhận dạng lời nói có giống chuyển lời nói thành văn bản không?
Chuyển lời nói thành văn bản là một ứng dụng và đầu ra phổ biến của nhận dạng lời nói. Nhận dạng lời nói cũng có thể diễn giải lệnh nói mà không tạo ra bản chép lời hiển thị.
Nhận dạng lời nói khác nhận dạng giọng nói như thế nào?
Nhận dạng lời nói xác định nội dung một người đã nói. Nhận dạng giọng nói hoặc nhận dạng người nói xác định hoặc xác minh người đang nói dựa trên các đặc điểm trong giọng của họ.
Đọc chính tả dùng nhận dạng lời nói hay nhận dạng giọng nói?
Đọc chính tả dùng nhận dạng lời nói, thường kết hợp với chuyển lời nói thành văn bản, để đưa lời nói vào tài liệu hoặc trường văn bản. Nó không cần xác định người nói.
Đọc chính tả khác chép lời như thế nào?
Đọc chính tả thường là một người chủ ý soạn văn bản. Chép lời tạo bản ghi từ âm thanh trực tiếp hoặc đã được thu và có thể thêm dấu thời gian, nhãn người nói cùng liên kết phát lại.
Nhập liệu bằng giọng nói khác điều khiển bằng giọng nói như thế nào?
Nhập liệu bằng giọng nói đưa từ ngữ vào vị trí con trỏ. Điều khiển bằng giọng nói còn vận hành các thành phần giao diện, điều hướng ứng dụng, chọn văn bản và thực hiện thao tác trên máy tính bằng lời nói.
Talkpad hiện có trên macOS và Windows. Gói Pro có giá $8/tháng hoặc $6/tháng khi thanh toán theo năm cho nhu cầu sử dụng nhiều hơn. Tải Talkpad miễn phí – 2.500 từ mỗi tuần trong gói miễn phí.
