Định giá ElevenLabs đạt 22 tỷ USD: Phỏng vấn CEO Mati Staniszewski về tương lai giọng nói AI
ElevenLabs hiện đạt mức doanh thu địnhrecurring hàng năm 600 triệu USD và được định giá tới 22 tỷ USD ở tuổi đời mới bốn năm. CEO Mati Staniszewski chia sẻ về chiến lược kinh doanh, sự cạnh tranh với chính khách hàng và mục tiêu vượt qua bài kiểm tra Turing cho AI hội thoại.
ElevenLabs xây dựng lớp giọng nói cho AI, các mô hình chuyển văn bản thành giọng nói giống con người. Hầu hết mọi người tiếp xúc với công nghệ này khi trò chuyện với dịch vụ khách hàng — thường là mà không nhận ra. Ví dụ, Klarna đang vận hành tổng đài hỗ trợ tuyến đầu cho 35 triệu khách hàng tại Mỹ bằng công nghệ này. Deutsche Telekom, Cisco, Adobe và ngày càng nhiều chính phủ cũng sử dụng. ElevenLabs cũng bán sản phẩm cho các nhà sáng tạo, những người sử dụng nền tảng này cho sách nói, lồng tiếng và âm nhạc.
Công ty không đơn độc trong lĩnh vực này. Trên thực tế, họ ngày càng chạm trán với các khách hàng của mình, bao gồm Decagon — một nền tảng AI trò chuyện từng huấn luyện sản phẩm giọng nói trên ElevenLabs và giờ đây cạnh tranh lại với hãng. Nhưng các nhà đầu tư của họ có vẻ không quá lo lắng. Công ty cho biết đang đạt tốc độ 600 triệu USD doanh thu định kỳ hàng năm (ARR), và hiện được các nhà đầu tư định giá ở mức 22 tỷ USD, dù mới chỉ bốn năm tuổi.
Để hiểu thêm, tôi đã phỏng vấn đồng sáng lập kiêm CEO của ElevenLabs, Mati Staniszewski, tại hội nghị doanh nhân Nrth ở Toronto (trước đây gọi là Elevate). Chúng tôi đã thảo luận về nhiều chủ đề trong thời gian ngắn, bao gồm việc liệu các doanh nghiệp có nên thông báo cho khách hàng khi họ đang nói chuyện với AI hay không (ông cho rằng nên làm vậy), và liệu ông có thể thảo luận về tỷ suất lợi nhuận gộp của công ty hay không. Không có gì ngạc nhiên khi Staniszewski cho biết ông không thể thảo luận chi tiết, nhưng ông tỏ rõ quan điểm rằng ông không ngại việc tỷ suất lợi nhuận tiếp tục bị thu hẹp nếu điều đó giúp mở rộng thị phần của công ty.
Cuộc trò chuyện của chúng tôi đã được biên tập và cô đọng lại dưới đây.
Bạn từng tham gia TechCrunch Disrupt năm ngoái và nói rằng các mô hình âm thanh sẽ bị thương mại hóa (commoditized) trong vòng vài năm tới. Bạn đánh giá dự đoán đó thế nào ở thời điểm hiện tại?
Vẫn còn rất nhiều việc phải làm, và khoảng cách chất lượng mà bạn có thể đạt được ngay ở cấp độ mô hình vẫn còn rất đáng kể. Nếu nhìn xa hơn, có lẽ từ ba đến năm năm nữa, những khác biệt đó sẽ nhỏ hơn. Điều chúng tôi muốn làm, và là những người đầu tiên làm được, là vượt qua bài kiểm tra Turing cho AI hội thoại. Bạn cần kết hợp trí tuệ, nhưng bạn cũng cần trí tuệ cảm xúc. Bạn cần hiểu cảm xúc của đối phương để có thể nói chậm lại hoặc nói to hơn. Điều đó vẫn chưa được thực hiện.
Tỷ lệ phần trăm doanh nghiệp trong mảng kinh doanh hiện tại là bao nhiêu?
Chúng tôi hiện đạt 600 triệu USD ARR. Hơn 55% là doanh nghiệp cổ điển (enterprise), và một phần lớn trong 45% [còn lại] là các doanh nghiệp nhỏ và vừa, lập trình viên, nhà xây dựng, nhà sáng tạo.
Giống như mọi công ty khác trong lĩnh vực AI, các bạn đang ngày càng cạnh tranh với chính khách hàng của mình. Decagon từng huấn luyện sản phẩm giọng nói trên nền tảng của các bạn và giờ đây thực hiện các truy vấn thông qua các mô hình của riêng họ.
Ranh giới ngày càng trở nên mờ nhạt. Khi chúng ta nghĩ về các công ty mô hình, công ty nền tảng, công ty ứng dụng, trong quá khứ bạn sẽ có sự phân chia rất rõ ràng nơi một bên bắt đầu và kết thúc. Ngày nay ranh giới đó mờ nhạt hơn nhiều. Trong trường hợp của Anthropic, từ một công ty mô hình giờ đây chắc chắn đã thành một nền tảng và ngày càng có thêm nhiều ứng dụng rộng rãi. Tôi nghĩ điều này sẽ tiếp tục diễn ra.
Khách hàng của bạn có thể chọn "lớp lập luận" (reasoning layer) từ một menu các tùy chọn tại ElevenLabs. Bạn nhận thấy điều gì về việc sử dụng các mô hình phòng thí nghiệm tiên tiến (frontier lab) so với các mô hình mở (open-weight)?
Đây không phải là một lựa chọn nhị phân. Trong trải nghiệm khách hàng, nếu bạn gọi đến chỉ để hỏi thông tin và không thực hiện bất kỳ hành động nào, bạn có thể sử dụng nhiều mô hình mã nguồn mở vì cơ sở tri thức của bạn định nghĩa thế nào là một trải nghiệm tốt. Nhưng nếu đó là dịch vụ tài chính, bạn muốn được xác thực, bạn muốn thông tin về một giao dịch, có thể là hoàn tiền. Sáu không có chỗ cho sai sót. Ở đây, các mô hình tiên tiến vẫn sẽ dẫn đầu.
Một số mô hình trọng số mở đó đến từ Trung Quốc. Chính phủ Mỹ là khách hàng. Chính phủ các nước châu Âu cũng là khách hàng. Những cuộc thảo luận đó diễn ra như thế nào?
Khác nhau. Trong mỗi lần triển khai, các mô hình và giọng nói chúng tôi triển khai sẽ phụ thuộc vào từng trường hợp. Nếu chúng tôi làm việc với chính phủ Ba Lan hoặc chính phủ Brazil, họ có các bộ yêu cầu riêng. Đó có thể là mô hình trọng số mở, mô hình nguồn đóng, hoặc mô hình tự tinh chỉnh của riêng họ. [Ở Ba Lan,] đó là trường hợp y tế. Bạn có bệnh nhân đặt lịch hẹn qua hệ thống y tế công cộng và có tới 18% không bao giờ xuất hiện. Việc triển khai là các tác nhân (agents) gọi điện và nhắc nhở. Họ có một bộ mô hình được tối ưu hóa dựa trên kiến thức của mình và chúng tôi tích hợp trong khi vẫn giữ quyền cư trú dữ liệu (data residency).
Các doanh nghiệp có nên công khai khi ai đó đang nói chuyện với một tác nhân AI thay vì con người không?
Tôi nghĩ nên có sự công khai tại thời điểm này. Hiện tại, mọi người chưa quen với điều đó và mô hình chung là bạn không muốn cảm thấy bị lừa gạt trong cuộc gọi đó. Nhưng trong năm năm tới, khi mọi người đều có tác nhân riêng hoạt động thay mặt mình, bạn sẽ gọi đến và mong đợi một tác nhân. Khi đó tôi nghĩ xã hội sẽ thay đổi. Có những cách làm tốt — nếu có thời gian chờ 30 phút để gặp con người, hãy cho khách hàng lựa chọn. Trong hầu hết các trường hợp, họ chọn tác nhân và sau đó họ ngạc nhiên vì trải nghiệm lại tốt đến vậy.
Tỷ suất lợi nhuận gộp của các bạn là bao nhiêu, khi tính đến chi phí trả cho các mô hình và suy luận (inference)?
Tôi sẽ đưa ra một câu trả lời mơ hồ. Vì chúng tôi có yếu tố nghiên cứu đó, chúng tôi có thể tinh chỉnh và giới hạn các mô hình theo những cách cực kỳ thông minh. Nhưng nếu chúng tôi có thể chuyển bất kỳ khoản tiết kiệm nào cho khách hàng, chúng tôi sẽ làm điều đó. Điều lớn nhất vẫn là chứng minh giá trị và đồng hành cùng khách hàng. Vì vậy, nếu chúng tôi có thể đầu tư và chứng minh giá trị đó, chúng tôi không ngại việc biên lợi nhuận giảm xuống để thực sự cùng nhau hưởng lợi khi giá trị được tạo ra trong năm năm tới.
Các bạn có hàng triệu giờ cuộc gọi dịch vụ khách hàng. Các bạn có huấn luyện trên chúng không? Bao nhiêu phần trăm dữ liệu huấn luyện của các bạn là dữ liệu tổng hợp (synthetic)?
Ở một số công ty nhất định, chúng tôi đã cùng nhau tạo ra các mô hình. Họ muốn có một mô hình cụ thể cho trường hợp sử dụng của họ. Mặt khác, phần lớn dữ liệu huấn luyện không nằm ở khối lượng dữ liệu, mà là việc chú thích (annotating) dữ liệu. Chúng tôi có hàng ngàn người làm việc nội bộ theo hợp đồng giúp chúng tôi chú thích không chỉ những gì đã được nói, mà còn là thời điểm mọi người nói, cách họ nói những điều đó, và những cảm xúc được sử dụng. Chúng tôi phải mời các huấn luyện viên giọng nói đến để có thể phát hiện chính xác cácp điệu.
Có thông tin cho rằng các bạn đang hướng tới năm 2028 cho đợt phát hành cổ phiếu công khai lần đầu (IPO). Bạn có thể xác nhận điều đó không?
Chúng tôi rất muốn xây dựng một công ty đứng vững trước thử thách của thời gian. Chúng tôi đang chuẩn bị nền tảng để có thể làm điều đó trong những năm tới. Nhưng việc chúng tôi có làm hay không sẽ phụ thuộc vào thời gian và địa điểm.
'Những năm tới' là một khoảng thời gian rất mơ hồ.
[Cười.]
Phía sau hậu trường: Quan điểm của bạn về việc liệu các phòng thí nghiệm tiên tiến có nên giảm tốc độ phát triển hay không?
Mọi người đều đồng lòng làm việc cùng nhau để tìm ra cách điều tiết nhịp độ. Việc họ có nên công khai về điều đó hay không, và nó nên liên quan đến bao nhiêu cuộc trò chuyện truyền thông hay quy định pháp lý, đó là một chủ đề khác. Nhưng vâng, tất cả chúng ta nên thực hiện các biện pháp phòng ngừa thích hợp khi triển khai công nghệ. Chúng tôi không huấn luyện các mô hình văn bản và khía cạnh trí tuệ của các mô hình — vốn là cốt lõi của cuộc tranh luận.
ElevenLabs có thể gặp rủi ro giống như Hugging Face không?
Chúng tôi đi trước một bước, bởi vì chúng tôi không triển khai các phần tự nhân bản hoặc định kỳ của trí thông minh từ các tác nhân. Công nghệ của chúng tôi không cho phép bạn để các tác nhân tạo ra nhiều tác nhân hơn. Mọi khách hàng đều phải trải qua quy trình KYC (nhận biết khách hàng). Rủi ro an ninh mạng chắc chắn là một rủi ro đối với thế giới rộng lớn hơn, nhưng chúng tôi có sẵn các biện pháp phòng ngừa tốt.
🚀 ĐỊNH GIÁ ELEVENLABS ĐẠT 22 TỶ USD: PHỎNG VẤN CEO MATI STANISZEWSKI VỀ TƯƠNG LAI GIỌNG NÓI AI ElevenLabs xây dựng lớp giọng nói cho AI, các mô hình chuyển văn bản thành giọng nói giống con người. Hầu hết mọi người tiếp xúc với công nghệ này khi trò chuyện với dịch vụ khách hàng — thường là mà không nhận ra. Ví dụ, Klarna đang vận hành tổng đài hỗ trợ tuyến đầu cho 35 triệu khách hàng tại Mỹ bằng công nghệ này. Deutsche Telekom, Cisco, Adobe và ngày càng nhiều chính phủ cũng sử dụng. ElevenLabs cũng bán sản phẩm cho các nhà sáng tạo, những người sử dụng nền tảng này cho sách nói, lồng tiếng và âm nhạc. Công ty không đơn độc trong lĩnh vực này. Trên thực tế, họ ngày càng chạm trán với các khách hàng của mình, bao gồm Decagon — một nền tảng AI trò chuyện từng huấn luyện sản phẩm giọng nói trên ElevenLabs và giờ đây cạnh tranh lại với hãng. Nhưng các nhà đầu tư của họ có vẻ không quá lo lắng. Công ty cho biết đang đạt tốc độ 600 triệu USD doanh thu định kỳ hàng năm (ARR), và hiện được các nhà đầu tư định giá ở mức 22 tỷ USD, dù mới chỉ bốn năm tuổi. Để hiểu thêm, tôi đã phỏng vấn đồng sáng lập kiêm CEO của ElevenLabs, Mati Staniszewski, tại hội nghị doanh nhân Nrth ở Toronto (trước đây gọi là Elevate). Chúng tôi đã thảo luận về nhiều chủ đề trong thời gian ngắn, bao gồm việc liệu các doanh nghiệp có nên thông báo cho khách hàng khi họ đang nói chuyện với AI hay không (ông cho rằng nên làm vậy), và liệu ông có thể thảo luận về tỷ suất lợi nhuận gộp của công ty hay không. Không có gì ngạc nhiên khi Staniszewski cho biết ông không thể thảo luận chi tiết, nhưng ông tỏ rõ quan điểm rằng ông không ngại việc tỷ suất lợi nhuận tiếp tục bị thu hẹp nếu điều đó giúp mở rộng thị phần của công ty. Cuộc trò chuyện của chúng tôi đã được biên tập và cô đọng lại dưới đây. Bạn từng tham gia TechCrunch Disrupt năm ngoái và nói rằng các mô hình âm thanh sẽ bị thương mại hóa (commoditized) trong vòng vài năm tới. Bạn đánh giá dự đoán đó thế nào ở thời điểm hiện tại? Vẫn còn rất nhiều việc phải làm, và khoảng cách chất lượng mà bạn có thể đạt được ngay ở cấp độ mô hình vẫn còn rất đáng kể. Nếu nhìn xa hơn, có lẽ từ ba đến năm năm nữa, những khác biệt đó sẽ nhỏ hơn. Điều chúng tôi muốn làm, và là những người đầu tiên làm được, là vượt qua bài kiểm tra Turing cho AI hội thoại. Bạn cần kết hợp trí tuệ, nhưng bạn cũng cần trí tuệ cảm xúc. Bạn cần hiểu cảm xúc của đối phương để có thể nói chậm lại hoặc nói to hơn. Điều đó vẫn chưa được thực hiện. Tỷ lệ phần trăm doanh nghiệp trong mảng kinh doanh hiện tại là bao nhiêu? Chúng tôi hiện đạt 600 triệu USD ARR. Hơn 55% là doanh nghiệp cổ điển (enterprise), và một phần lớn trong 45% [còn lại] là các doanh nghiệp nhỏ và vừa, lập trình viên, nhà xây dựng, nhà sáng tạo. Giống như mọi công ty khác trong lĩnh vực AI, các bạn đang ngày càng cạnh tranh với chính khách hàng của mình. Decagon từng huấn luyện sản phẩm giọng nói trên nền tảng của các bạn và giờ đây thực hiện các truy vấn thông qua các mô hình của riêng họ. Ranh giới ngày càng trở nên mờ nhạt. Khi chúng ta nghĩ về các công ty mô hình, công ty nền tảng, công ty ứng dụng, trong quá khứ bạn sẽ có sự phân chia rất rõ ràng nơi một bên bắt đầu và kết thúc. Ngày nay ranh giới đó mờ nhạt hơn nhiều. Trong trường hợp của Anthropic, từ một công ty mô hình giờ đây chắc chắn đã thành một nền tảng và ngày càng có thêm nhiều ứng dụng rộng rãi. Tôi nghĩ điều này sẽ tiếp tục diễn ra. Khách hàng của bạn có thể chọn "lớp lập luận" (reasoning layer) từ một menu các tùy chọn tại ElevenLabs. Bạn nhận thấy điều gì về việc sử dụng các mô hình phòng thí nghiệm tiên tiến (frontier lab) so với các mô hình mở (open-weight)? Đây không phải là một lựa chọn nhị phân. Trong trải nghiệm khách hàng, nếu bạn gọi đến chỉ để hỏi thông tin và không thực hiện bất kỳ hành động nào, bạn có thể sử dụng nhiều mô hình mã nguồn mở vì cơ sở tri thức của bạn định nghĩa thế nào là một trải nghiệm tốt. Nhưng nếu đó là dịch vụ tài chính, bạn muốn được xác thực, bạn muốn thông tin về một giao dịch, có thể là hoàn tiền. Sáu không có chỗ cho sai sót. Ở đây, các mô hình tiên tiến vẫn sẽ dẫn đầu. Một số mô hình trọng số mở đó đến từ Trung Quốc. Chính phủ Mỹ là khách hàng. Chính phủ các nước châu Âu cũng là khách hàng. Những cuộc thảo luận đó diễn ra như thế nào? Khác nhau. Trong mỗi lần triển khai, các mô hình và giọng nói chúng tôi triển khai sẽ phụ thuộc vào từng trường hợp. Nếu chúng tôi làm việc với chính phủ Ba Lan hoặc chính phủ Brazil, họ có các bộ yêu cầu riêng. Đó có thể là mô hình trọng số mở, mô hình nguồn đóng, hoặc mô hình tự tinh chỉnh của riêng họ. [Ở Ba Lan,] đó là trường hợp y tế. Bạn có bệnh nhân đặt lịch hẹn qua hệ thống y tế công cộng và có tới 18% không bao giờ xuất hiện. Việc triển khai là các tác nhân (agents) gọi điện và nhắc nhở. Họ có một bộ mô hình được tối ưu hóa dựa trên kiến thức của mình và chúng tôi tích hợp trong khi vẫn giữ quyền cư trú dữ liệu (data residency). Các doanh nghiệp có nên công khai khi ai đó đang nói chuyện với một tác nhân AI thay vì con người không? Tôi nghĩ nên có sự công khai tại thời điểm này. Hiện tại, mọi người chưa quen với điều đó và mô hình chung là bạn không muốn cảm thấy bị lừa gạt trong cuộc gọi đó. Nhưng trong năm năm tới, khi mọi người đều có tác nhân riêng hoạt động thay mặt mình, bạn sẽ gọi đến và mong đợi một tác nhân. Khi đó tôi nghĩ xã hội sẽ thay đổi. Có những cách làm tốt — nếu có thời gian chờ 30 phút để gặp con người, hãy cho khách hàng lựa chọn. Trong hầu hết các trường hợp, họ chọn tác nhân và sau đó họ ngạc nhiên vì trải nghiệm lại tốt đến vậy. Tỷ suất lợi nhuận gộp của các bạn là bao nhiêu, khi tính đến chi phí trả cho các mô hình và suy luận (inference)? Tôi sẽ đưa ra một câu trả lời mơ hồ. Vì chúng tôi có yếu tố nghiên cứu đó, chúng tôi có thể tinh chỉnh và giới hạn các mô hình theo những cách cực kỳ thông minh. Nhưng nếu chúng tôi có thể chuyển bất kỳ khoản tiết kiệm nào cho khách hàng, chúng tôi sẽ làm điều đó. Điều lớn nhất vẫn là chứng minh giá trị và đồng hành cùng khách hàng. Vì vậy, nếu chúng tôi có thể đầu tư và chứng minh giá trị đó, chúng tôi không ngại việc biên lợi nhuận giảm xuống để thực sự cùng nhau hưởng lợi khi giá trị được tạo ra trong năm năm tới. Các bạn có hàng triệu giờ cuộc gọi dịch vụ khách hàng. Các bạn có huấn luyện trên chúng không? Bao nhiêu phần trăm dữ liệu huấn luyện của các bạn là dữ liệu tổng hợp (synthetic)? Ở một số công ty nhất định, chúng tôi đã cùng nhau tạo ra các mô hình. Họ muốn có một mô hình cụ thể cho trường hợp sử dụng của họ. Mặt khác, phần lớn dữ liệu huấn luyện không nằm ở khối lượng dữ liệu, mà là việc chú thích (annotating) dữ liệu. Chúng tôi có hàng ngàn người làm việc nội bộ theo hợp đồng giúp chúng tôi chú thích không chỉ những gì đã được nói, mà còn là thời điểm mọi người nói, cách họ nói những điều đó, và những cảm xúc được sử dụng. Chúng tôi phải mời các huấn luyện viên giọng nói đến để có thể phát hiện chính xác cácp điệu. Có thông tin cho rằng các bạn đang hướng tới năm 2028 cho đợt phát hành cổ phiếu công khai lần đầu (IPO). Bạn có thể xác nhận điều đó không? Chúng tôi rất muốn xây dựng một công ty đứng vững trước thử thách của thời gian. Chúng tôi đang chuẩn bị nền tảng để có thể làm điều đó trong những năm tới. Nhưng việc chúng tôi có làm hay không sẽ phụ thuộc vào thời gian và địa điểm. 'Những năm tới' là một khoảng thời gian rất mơ hồ. [Cười.] Phía sau hậu trường: Quan điểm của bạn về việc liệu các phòng thí nghiệm tiên tiến có nên giảm tốc độ phát triển hay không? Mọi người đều đồng lòng làm việc cùng nhau để tìm ra cách điều tiết nhịp độ. Việc họ có nên công khai về điều đó hay không, và nó nên liên quan đến bao nhiêu cuộc trò chuyện truyền thông hay quy định pháp lý, đó là một chủ đề khác. Nhưng vâng, tất cả chúng ta nên thực hiện các biện pháp phòng ngừa thích hợp khi triển khai công nghệ. Chúng tôi không huấn luyện các mô hình văn bản và khía cạnh trí tuệ của các mô hình — vốn là cốt lõi của cuộc tranh luận. ElevenLabs có thể gặp rủi ro giống như Hugging Face không? Chúng tôi đi trước một bước, bởi vì chúng tôi không triển khai các phần tự nhân bản hoặc định kỳ của trí thông minh từ các tác nhân. Công nghệ của chúng tôi không cho phép bạn để các tác nhân tạo ra nhiều tác nhân hơn. Mọi khách hàng đều phải trải qua quy trình KYC (nhận biết khách hàng). Rủi ro an ninh mạng chắc chắn là một rủi ro đối với thế giới rộng lớn hơn, nhưng chúng tôi có sẵn các biện pháp phòng ngừa tốt. 🗞 Nguồn: TechCrunch #vgsnews #vgs #tintuc
Nguồn: TechCrunch