Bản tin công nghệ quốc tế · dịch tiếng Việt 11.10.2026 RSS
AI & Dữ liệu · TechCrunch

Giới chuyên gia nhận định AI giọng nói vẫn chưa có 'khoảnh khắc ChatGPT' của riêng mình

Mặc dù các khoản đầu tư đang đổ dồn vào các startup AI giọng nói và nhiều mô hình mới liên tục ra mắt, các chuyên gia trong ngành cho rằng công nghệ này vẫn chưa thực sự đạt đến một cột mốc bùng nổ mang tính cách mạng như ChatGPT. Những thách thức lớn vẫn còn tồn đọng bao gồm tốc độ suy luận, độ chính xác của việc nhận diện giọng nói và khả năng duy trì sự tự nhiên trong giao tiếp.

TechCrunch11.10.20265 phút đọc0 lượt đọc

Lý thuyết cho rằng giọng nói sẽ là giao diện lớn tiếp theo đang tạo ra đà tăng trưởng mạnh mẽ, khi các nhà đầu tư rót hàng tỷ USD vào các startup AI giọng nói hoạt động trong nhiều lĩnh vực, từ nhà phát triển mô hình đến nhà cung cấp dịch vụ chăm sóc khách hàng doanh nghiệp, từ ứng dụng ghi chép cuộc họp cho đến công nhận đọc chính tả bằng AI.

Mỗi tuần đều có một mô hình hoặc công cụ mới được phát hành, tự nhận là có âm thanh giống con người và trò chuyện được như con người. Tuy nhiên, trên thực tế, điều đó có thể không phải như vậy. Shawn Wen, Giám đốc Công nghệ của nền tảng AI giọng nói doanh nghiệp PolyAI, cho rằng bất chấp sự ra mắt của các mô hình song công toàn phần (full-duplex) — có thể nói chuyện trong lúc đang lắng nghe bạn — AI giọng nói vẫn chưa có "khoảnh khắc ChatGPT" của riêng mình.

"Chúng ta đã đạt được cột mốc phát triển các mô hình song công toàn phần. Thách thức tiếp theo là làm cho khả năng suy luận diễn ra rất nhanh, để các mô hình có thể tìm nạp câu trả lời nhanh chóng và cuộc trò chuyện mang lại cảm giác tự nhiên," ông chia sẻ trên sân khấu tại hội nghị HumanX vào tháng trước.

Ông cũng cho biết các tác nhân AI trong dịch vụ chăm sóc khách hàng không nên phát ra âm thanh giống robot và phải mang lại cho người gọi đủ sự tự tin rằng họ có thể giải quyết được các vấn đề.

"Tôi nghĩ giai đoạn tiếp theo sẽ khác biệt một chút vì một khi giọng nói đã đủ tốt và khách hàng sẵn sàng tương tác với chúng trong hai hoặc ba lượt đầu tiên, họ bắt đầu xây dựng được niềm tin, và theo thời gian, họ sẽ cảm thấy mình có lẽ không cần phải nói chuyện với con người nếu tác nhân đó có thể giải quyết được vấn đề của họ," ông nói.

Alex Gay, Giám đốc Marketing của ứng dụng ghi chép cuộc họp Otter, nhận định rằng việc nhận diện người nói, nắm bắt ý định và kết nối điều đó với tri thức của tổ chức là một bước quan trọng để hỗ trợ tự động hóa. Công ty cũng đang nghiên cứu các bản sao kỹ thuật số (digital twin) có thể đại diện cho mọi người trong các cuộc họp. Đối với công nghệ đó, ông cho biết điều tối quan trọng là âm thanh đầu ra phải thể hiện được những biểu cảm cảm xúc giống như khi nói chuyện với một con người trong cuộc họp.

"Nếu bạn nghĩ về các cuộc họp mà bạn đang tham gia ngay bây giờ, những cuộc trò chuyện tuyệt vời nhất là khi bạn có thể tranh luận, thảo luận chiến lược và khi bạn cảm thấy có một mối quan hệ làm nền tảng cho điều đó. Nếu bạn không thể làm được điều đó với một hình đại diện (avatar), thì đó chỉ là một chatbot hỏi đáp," Gay lưu ý.

Sự hiểu biết và tính minh bạch của AI giọng nói

Mặc dù các mô hình AI giọng nói đã được cải thiện, các trợ lý AI thường không hiểu người dùng, hoặc ứng dụng ghi chép cuộc họp của bạn hiển thị sai bản ghi chép hoặc bản tóm tắt.

Wen cho rằng các mô hình ASR (Nhận diện giọng nói tự động) thường bỏ lỡ các từ khóa quan trọng, và điều đó gây ra vấn đề trong việc nắm bắt toàn bộ ngữ cảnh.

Gay của Otter đồng ý với điều này, đồng thời cho biết công ty vẫn đang tiếp tục làm việc để cải thiện tính năng phiên âm. Ông cũng cho biết ngôn ngữ là một lĩnh vực mà các mô hình giọng nói cần phải cải thiện.

"Đối với Otter, bạn biết đấy, việc phiên âm chưa bao giờ là điểm kết thúc. Đó chỉ là lớp nền tảng để chúng tôi có thể bắt đầu thúc đẩy một số lợi ích về năng suất dựa trên đó. Nhưng nếu bản phiên âm ban đầu của bạn không có độ chính xác mà bạn cần, tất cả các hành động tiếp theo của bạn sẽ trở nên có lỗi. Và ngay khi quá trình đó bắt đầu thực hiện hành động mà lại bị sai, bạn sẽ mất niềm tin vào nền tảng. Việc tiếp tục cải thiện mô hình ASR đó là điều tối quan trọng đối với chúng tôi vì tất cả các tác động hạ nguồn đều rất đáng kể," ông nói.

Với các công cụ giọng nói mới, cũng có một câu hỏi về tính minh bạch. Các công cụ nên thông báo cho khách hàng biết rằng họ đang được ghi âm hoặc đang nói chuyện với AI. Otter cho biết họ muốn tạo dựng niềm tin ở những người tham gia cuộc họp, vì vậy ngay cả đối với một cuộc họp mà bot không có mặt, họ muốn thử các phương pháp như thông báo cho mọi người trong đoạn chat rằng cuộc họp đang được ghi âm. Wen của PolyAI cũng cho biết điều quan trọng là phải xác định rõ rằng mọi người đang nói chuyện với một AI trong các cuộc gọi doanh nghiệp.

🔗 Bài gốc (tiếng Anh): These execs think voice AI hasn’t reached its ChatGPT moment yet
Nguồn: TechCrunch

Cùng chuyên mục · AI & Dữ liệu
AI & Dữ liệu

Lưu lượng bot Yandex của Nga giảm mạnh sau các cuộc tấn công bằng UAV của Ukraine

Lưu lượng bot từ mạng lưới Yandex đã giảm xuống mức gần như bằng không sau khi các trung tâm dữ liệu lớn của hãng này…

Tom's Hardware · 3 phút đọc
AI & Dữ liệu

Elon Musk thừa nhận không biết cách chế tạo chip, chỉ vài tuần sau dự đoán Trung Quốc vượt qua giới hạn bán dẫn

Elon Musk vừa thừa nhận ông vẫn phải học hỏi rất nhiều về quy trình sản xuất chất bán dẫn và chưa biết cách chế tạo…

Wccftech · 5 phút đọc
AI & Dữ liệu

Hành trình trải nghiệm AI cục bộ: Hào hứng, choáng ngợp và đầy ức chế

Tác giả chia sẻ hành trình bước đầu thử nghiệm chạy các mô hình AI cục bộ trên máy tính để bảo mật dữ liệu cá nhân.…

The Verge · 2 phút đọc