Bản tin công nghệ quốc tế · dịch tiếng Việt 26.09.2026 RSS
AI & Dữ liệu · TechCrunch

Tôi đã tạo ra một bản sao avatar kỹ thuật số bằng AI của chính mình và bạn có thể trò chuyện với nó

Tác giả từ TechCrunch đã trải nghiệm tạo ra một avatar kỹ thuật số tương tác của chính mình thông qua startup Synthesia. Bản sao AI này được huấn luyện để trả lời các câu hỏi cụ thể dựa trên một bài báo đã xuất bản, mở ra góc nhìn mới về ứng dụng AI trong truyền thông và báo chí.

TechCrunch26.09.202610 phút đọc0 lượt đọc

Khi Alexandru Voica, Giám đốc các vấn đề doanh nghiệp tại startup tạo video Synthesia, gửi cho tôi một đường dẫn vào mùa hè này về thành viên mới nhất trong đội ngũ PR của họ, tôi đã rất ngạc nhiên. Đó là một avatar ảo tương tác của anh ấy, được huấn luyện để trả lời các câu hỏi báo chí phổ biến về Synthesia như công ty làm gì và hoạt động ra sao. Một ngày trước đó, tôi tham gia một hội panel nơi các chuyên gia PR hỏi tôi rằng liệu tôi có phiền với các bài pitch sử dụng văn bản do AI tạo ra hay không. Nhưng avatar của Alexandru còn vượt xa mức đó — đối với tôi, đây có vẻ như là "trùm cuối" của việc ứng dụng AI trong ngành PR.

Vào tháng 9, Synthesia đã mời tôi đến văn phòng mới của họ tại New York. Ban đầu có trụ sở tại Anh, Synthesia là một startup avatar kỹ thuật số nổi bật bên cạnh những cái tên khác như D-ID, HeyGen và Colossyan. Công ty đã đạt mức định giá 4 tỷ USD vào đầu năm nay và cho biết vào năm ngoái họ đã vượt mốc 100 triệu USD doanh thu định kỳ hàng năm (ARR).

Synthesia cho phép các doanh nghiệp xây dựng video đào tạo tương tác bằng avatar AI và gần đây đã ra mắt một sản phẩm mang tên Roleplay Sessions, cho phép nhân viên thực hành, chẳng hạn như luyện tập cách thuyết trình bán hàng với một avatar AI tương tác có khả năng phản hồi và chấm điểm câu trả lời của họ.

Khi tôi đến dự lễ khai trương văn phòng mới và họ hỏi liệu tôi có muốn sở hữu một avatar AI cho riêng mình không, tôi đã đồng ý ngay mà không do dự. Tất nhiên là tôi muốn có một bản sao kỹ thuật số của chính mình rồi. Hôm đó trang phục của tôi rất đẹp và tóc tai thì gọn gàng.

Cho đến khi gặp bản sao kỹ thuật số của mình, tôi vốn dĩ khá thờ ơ với các loại avatar, nhưng tôi cảm thấy chúng chắc chắn sẽ trở thành một phần trong đời sống trực tuyến hàng ngày. Tôi từng nghe về việc mọi người trên Instagram tạo ra avatar giống hệt mình để giúp họ làm nội dung mạng xã hội. Tôi thấy tất cả những điều này rất thú vị, và có lẽ đó là lý do tại sao bây giờ tôi không ngần ngại giới thiệu bản sao kỹ thuật số của mình với các bạn. Đây là lần đầu tiên Synthesia tạo ra một avatar kỹ thuật số cho một nhà báo (hoặc cho bất kỳ ai, tính đến thời điểm hiện tại, ngoài Voica). Nó được huấn luyện dựa trên bài viết của tôi về lý do tại sao các startup được quỹ đầu tư mạo hiểm hậu thuẫn lại phạm nhiều gian lận hơn so với các startup không nhận vốn VC, và nó sẽ chỉ trả lời các câu hỏi liên quan đến bài viết đó.

Dưới đây, bạn chỉ cần nhấn "bắt đầu trong một cửa sổ mới" để bắt đầu.

Bạn có thể hỏi nó những câu hỏi như:

  • Tại sao tôi quyết định viết câu chuyện này?
  • Bài báo nghiên cứu nói về điều gì?
  • Các nhà nghiên cứu đã phát hiện ra những gì?

Để tạo ra sản phẩm này, tôi bước vào một studio quay phim thu nhỏ nằm bên trong văn phòng của Synthesia, nơi họ chụp rất nhiều bức ảnh về tôi và ghi lại bản ghi âm giọng nói kéo dài hai phút. Tôi phải đồng thế cho phép tạo ra các avatar này, và thế là "Dom kỹ thuật số" đã ra đời. Họ tạo ra một avatar cá nhân cho tôi (chỉ đọc bất kỳ kịch bản nào tôi cung cấp) — có và không có kính, đồng thời họ cũng tạo ra hai avatar tương tác cho tôi (những avatar có thể trò chuyện lại và lắng nghe tôi), cũng có và không có kính.

Chúng tôi chọn một bài báo để huấn luyện cho avatar tương tác, và sau đó một trong các nhóm đã xây dựng avatar tương tác của tôi, được cung cấp sức mạnh bởi sự kết hợp giữa các mô hình chuyển giọng nói thành văn bản, video, ngôn ngữ và chuyển văn bản thành giọng nói. Ngăn xếp công nghệ (tech stack) của avatar tôi bao gồm các mô hình video và giọng nói của riêng Synthesia, mặc dù công ty cũng cho phép khách hàng lựa chọn các giải pháp thay thế từ các phòng thí nghiệm khác như Cartesia, ElevenLabs, Google hoặc OpenAI. Các doanh nghiệp cũng có thể chọn lưu trữ avatar của họ trên bất kỳ nền tảng đám mây nào họ muốn hoặc trả tiền cho Synthesia để lưu trữ chúng.

Mô hình chuyển giọng nói thành văn bản biến những gì mọi người nói thành văn bản, mô hình ngôn ngữ tác nhân (agentic language model) hiểu được văn bản và có thể thực hiện các hành động dựa trên đó, mô hình chuyển văn bản thành giọng nói biến phản hồi thành âm thanh, và cuối cùng là mô hình video (do Synthesia xây dựng) tạo hiệu ứng hoạt hình cho avatar khi nó nói chuyện.

Nhìn chung, Synthesia xây dựng ba loại sản phẩm — một nền tảng tạo và phân phối video với các avatar cổ điển, nơi ai đó gõ một kịch bản và avatar sẽ lặp lại nội dung đó; một nền tảng tác nhân có tên là Sessions nơi mọi người có thể tương tác với các avatar trong các cuộc khảo sát hoặc đóng vai (roleplay); và một nền tảng API nơi mọi người có thể lấy các mô hình video và giọng nói của Synthesia kết hợp với các dịch vụ công nghệ khác để xây dựng avatar tương tác hoặc các loại sản phẩm khác.

Nhóm Synthesia mất vài ngày để hoàn thiện các avatar của tôi. Đầu tiên, tôi thử nghiệm với các avatar cá nhân và gõ một kịch bản khá chung chung để xem giọng nói AI của mình nghe như thế nào. Tôi cho nó nói về việc mùa thu đã đến New York như thế nào, khoảng thời gian trong năm mà tôi yêu thích nhất. Giọng nói khá chính xác và tôi rất vui vì nó không thu lại bất kỳ sự khàn giọng nào mà tôi gặp phải khi ghi âm mẫu giọng nói của mình.

Tôi cho một số bạn bè không làm trong ngành công nghệ xem và họ thấy nó vừa thú vị vừa có chút rợn tóc gáy.

Sau đó, tôi cho họ xem avatar tương tác của mình, vốn mang tính chất tất định (deterministic), có nghĩa là nó sẽ chỉ nói những gì nó được huấn luyện để phản hồi. Trong trường hợp này, đó là câu chuyện gian lận khởi nghiệp của tôi. Tôi đã hỏi nó những câu hỏi như tôi từng làm việc ở đâu trước TechCrunch và tôi sống ở khu vực nào của New York, nhưng mỗi lần như vậy nó đều lái tôi quay trở lại bài báo.

Bạn bè của tôi không nghĩ giọng nói đó giống tôi lắm và cho rằng độ giống thực tế không bằng avatar cá nhân, nhưng dù sao thì nó cũng đủ gần để mang lại cảm giác hơi rùng rợn. Mẹ tôi gọi đó là "tuyệt vời", một lời khen ngợi khá cao từ bà. Bà và bố tôi cứ liên tục cố gắng hỏi nó những câu hỏi "chỉ có họ mới biết" về tôi — nhưng mô hình không trả lời, và mỗi lần đều hướng họ quay lại câu chuyện gian lận khởi nghiệp.

"Mẹ không nhớ là mình sinh ra tới hai đứa con," bà đùa sau khi thử nghiệm mô hình.

Trải nghiệm này khiến tôi suy nghĩ về tương lai của báo chí sẽ ra sao. Liệu mọi người có ổn không nếu bật bản tin lên và thấy nó được trình bày bởi một avatar? Một nhà đầu tư nói với tôi là không ngay lập tức. Chắc chắn hiện nay có rất nhiều sự phản đối đối với nội dung rác do AI tạo ra đã thâm nhập vào mạng xã hội và các nền tảng chia sẻ tin tức khác. Nhưng những người khác mà tôi hỏi thì không chắc chắn như vậy. Liệu avatar có thể bổ sung — hoặc thậm chí thay thế — các nhà báo không? Liệu các CEO có muốn nói chuyện với avatar AI của một nhà báo hơn là một con người bằng xương bằng thịt không?

Điều tôi thích trong sự nghiệp của mình là kết nối với mọi người, viết các câu chuyện và nghiên cứu các chủ đề mới. Nhưng phần quan trọng nhất của báo chí là lòng tin. Có vẻ như điều đó không bao giờ có thể thuê ngoài cho AI được.

Ngoài lĩnh vực báo chí, tôi tin chắc rằng ý tưởng tự nhân bản bản thân có thể rất hấp dẫn. Sẽ không còn cảnh phải giải quyết công việc tồn đọng sau kỳ nghỉ lễ hay đi nghỉ mát, bởi vì một phiên bản của bạn luôn có thể hiện diện để trả lời các câu hỏi.

Chúng ta sẽ phải chờ xem việc sử dụng avatar tiến triển như thế nào trong giới doanh nghiệp Mỹ. Nhưng bây giờ khi đã có avatar của riêng mình, tôi có những cảm xúc lẫn lộn. Sau khi vượt qua sự bỡ ngỡ ban đầu, tôi đã săm soi kỹ lưỡng avatar của mình sau khi nó ngừng nói và chờ đợi — không biết là chờ đợi điều gì. Có chăng là tôi đang đợi nó chớp mắt? Hay nói một điều gì đó mới, hoặc mỉm cười, hay chỉ để cho tôi biết rằng nó có ý thức.

Vì các bản sao kỹ thuật số của tôi mang tính tất định, chúng sẽ không bao giờ làm điều đó. Nhưng tôi có thể hiểu việc rơi vào trạng thái tâm lý không ổn định vì AI dễ dàng đến nhường nào nếu dùng một avatar mang tính phi tất định (nondeterministic), nghĩa là được vận hành bởi một chatbot tự do bàn luận.

Tôi từng nói với một nhà đầu tư rằng, bất kể tương lai của các bản sao kỹ thuật số ra sao, tôi dự đoán thế hệ của tôi, Gen Z, có thể sẽ không bao giờ quen với chúng. Chúng mang cảm giác khoa học viễn tưởng: Mọi thứ chúng ta từng thấy trong phim ảnh nay đã hiện hữu ngoài đời thực. Nhưng tôi phải thừa nhận rằng, tôi thấy avatar kỹ thuật số ít gây sốc hơn so với người máy hình người (humanoids). Ít nhất là với avatar, nếu mọi thứ trở nên kỳ lạ, tôi luôn có thể đăng xuất.

Tuy nhiên, cho đến lúc đó, đây là avatar cá nhân của tôi, sẽ điểm qua tất cả các câu chuyện hàng đầu trên trang web của chúng tôi trong tuần này!

Khi bạn mua sắm qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể nhận được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập trong biên tập của chúng tôi.


Cùng chuyên mục · AI & Dữ liệu
AI & Dữ liệu

CEO Cloudflare: Lưu lượng truy cập bot đã vượt qua con người, đặt ra thách thức lớn cho mô hình kinh doanh web

Matthew Prince, CEO Cloudflare, cho biết lưu lượng truy cập tự động từ bot và AI hiện đã chính thức vượt qua con người…

The Verge · 1 phút đọc
AI & Dữ liệu

ChatGPT-6 Astra giải mã thành công bức điện Enigma 85 tuổi chỉ trong hai ngày

Một bức điện mã hóa bằng máy Enigma của quân đội Đức từ năm 1941 vừa được giải mã thành công bởi hệ thống GPT-Astra chỉ…

Tom's Hardware · 1 phút đọc
AI & Dữ liệu

Tính năng ChatGPT Voice giờ đây có thể kết nối ứng dụng, yêu cầu xác nhận trực tiếp trên màn hình

Kể từ thứ Tư, chế độ giọng nói của ChatGPT đã có thể lấy dữ liệu từ các ứng dụng như Gmail, Google Calendar và Slack…

Notebookcheck · 1 phút đọc