Bản tin công nghệ quốc tế · dịch tiếng Việt 04.09.2026 RSS
AI & Dữ liệu · The Verge

Tại sao hình ảnh món ăn do AI tạo ra lại trông kinh dị và khó nuốt đến vậy?

Nhiều nhà hàng và thương hiệu đang dùng AI để tạo ảnh quảng cáo món ăn, nhưng lại cho ra những sản phẩm kỳ dị, từ tôm giống bánh donut đến mì trông như giun sán. Các chuyên gia giải thích điều này bắt nguồn từ hạn chế kỹ thuật của mô hình khuếch tán (diffusion model), việc thiếu hiểu biết thực tế của AI và cách con người phản ứng với sự bất thường.

The Verge04.09.202610 phút đọc1 lượt đọc
Ảnh: The Verge

Đang có một làn sóng hình ảnh ẩm thực kỳ dị và kém hấp dẫn xuất hiện từ các nhà hàng, quán cà phê và thương hiệu – những nơi ngày càng lạm dụng AI để tạo ảnh quảng cáo đồ ăn. Những thảm họa hình ảnh này bao gồm tôm bánh donut, bánh mì kẹp thịt bò muối từ địa ngục, mì giống giun, bánh ngọt dạng sợi và thịt gà xơ xác. Ngoài ra còn có vật liệu xây dựng trá hình thành kem, kem trá hình thành bộ não, cùng nhiều món ăn mang âm hưởng kiến trúc khác. Tôi thậm chí không biết phải bắt đầu mô tả nỗ lực tạo ra chiếc burger quái monstros này như thế nào, và tốt nhất là không nên bàn tới chiếc burrito đầy lỗ chỗ gây sợ hãi lỗ (trypophobia) với đầy rẫy giòi bọ bên trong. Có những khối u cục. Và những cái lỗ. Quá nhiều lỗ.

"Các mô hình khuếch tán nổi tiếng là yếu kém trong việc tạo ra các cấu trúc mỏng, liên tục và có điểm kết thúc."

Chúng ta thường không hiểu tại sao lại có người dùng hình ảnh rác do AI tạo ra để bán một thứ vốn dĩ phải trông ngon mắt, đặc biệt là khi món ăn thực tế có lẽ đang ở ngay đó để chụp ảnh. Nhưng chúng ta phần nào hiểu được lý do tại sao AI lại rất giỏi trong việc tạo ra những bức ảnh gây buồn nôn tinh tế đến vậy.

Có rất nhiều lý do khiến món ăn do AI tạo ra lại trở nên sai lệch đến thế, từ các chi tiết kỹ thuật về cách hệ thống AI tạo ra hình ảnh và dữ liệu dùng để huấn luyện chúng, cho đến gánh nặng tâm lý mà con người áp đặt khi nhìn nhận những hình ảnh đó. Vấn đề thường bắt đầu ngay từ bước đầu tiên. Nhiều công cụ tạo ảnh hàng đầu tạo ra hình ảnh bằng phương pháp khuếch tán (diffusion). Nói một cách đơn giản, các mô hình khuếch tán bắt đầu bằng một bức ảnh nhiễu thuần túy — giống như một màn hình đầy tĩnh điện — và dần dần loại bỏ nhiễu từng chút một để tạo ra hình ảnh theo yêu cầu.

Chris Russell, giáo sư về AI, chính phủ và chính sách tại Đại học Oxford kiêm chuyên gia về thị giác máy tính, giải thích: "Điều này có nghĩa là các cấu trúc thô ban đầu được khôi phục trước, sau đó các chi tiết kết cấu mịn mới xuất hiện ở cuối."

Russell cho biết trong nhiều hình ảnh món ăn gây khó chịu này, mọi thứ đã chệch hướng từ trước khi các chi tiết tinh tế hơn được thêm vào. Mô hình có thể nhầm lẫn cấu trúc cơ bản của một đối tượng ở giai đoạn đầu, sau đó đắp các chi tiết kết cấu sống động lên trên cấu trúc đó. Russell nói: "Đây cũng là kiểu lỗi tương tự như khi một con người được tạo ra với sáu ngón tay thay vì năm." (Điều này cũng có thể giải thích cho trường hợp tôm bánh donut.)

Ngay cả khi cấu trúc nền tảng vững chắc, các chi tiết tinh tế hơn vẫn có thể gặp trục trặc theo cách riêng của chúng, theo Giovanbattista Califano, nhà khoa học hành vi nghiên cứu phản ứng với hình ảnh do AI tạo ra tại Đại học Naples Federico II ở Ý. Ông cho biết: "Các mô hình khuếch tán nổi tiếng là yếu kém trong việc tạo ra các cấu trúc mỏng, liên tục và có điểm kết thúc. Mì, các sợi và các phần phụ là chính là kiểu hình học khiến chúng vấp ngã, vì vậy bạn sẽ thấy các vật thể giống mì spaghetti tràn lan vào những nơi không có logic giải phẫu hoặc ẩm thực nào."

Nói cách khác, một khi mô hình bắt đầu tạo ra thứ gì đó như thế này, nó có thể gặp khó khăn trong việc tìm ra điểm dừng hoặc xác định vật đó nên gắn liền với cái gì. Các kết cấu lặp đi lặp lại khác như bong bóng và hạt cũng tương tự, rất khó để các mô hình khuếch tán giữ trong giới hạn hợp lý, ông cho biết thêm, điều này có nghĩa là chúng thường tràn sang các khu vực không nên có. Điều đó giúp giải thích tại sao rất nhiều hình ảnh đồ ăn do AI lại mang hình dạng sợi mì dày đặc, có hoa văn khó chịu và chi chít những lỗ cụm có thể kích hoạt chứng sợ lỗ (trypophobia).

Vấn đề càng trầm trọng hơn khi AI hoàn toàn không biết sandwich thực chất là gì. Hay mì là gì. Hay burrito là gì. Nó không có sự hiểu biết nào về các đối tượng mà nó đang tạo ra hoặc thế giới vật chất mà chúng đang tồn tại. Roland Meyer, giáo sư về văn hóa và nghệ thuật số tại Đại học Zurich ở Thụy Sĩ, giải thích rằng AI đã học được một cách rộng rãi về vẻ bề ngoài của những thứ này ở cấp độ thống kê, nhưng không hiểu tại sao chúng lại trông như vậy hoặc chúng phải hành xử ra sao.

Việc thiếu hiểu biết đó có thể dẫn đến một số cách giải thích thẩm mỹ đến quặn thắt dạ dày đối với những con người ngắm nhìn bức ảnh, theo Michael Cook, giảng viên cao cấp về khoa học máy tính tại King’s College London. Do đó mới có chuyện kem trông giống bê tông nứt nẻ, hoặc bánh burger có vẻ được làm từ đá. Các mô hình AI hoàn toàn không hiểu tại sao thức ăn không nên có hình dáng giống như những hình ảnh phi thực phẩm theo cách đó. Cook giải thích: "Những kết cấu này có thể trông hoàn toàn bình thường nếu được sử dụng trong bối cảnh kiến trúc. Nhưng chúng lại trở nên sai trái khi chúng ta hình dung đó là thức ăn có thể ăn được.

Các hình ảnh dùng để huấn luyện những mô hình này có thể làm cho vấn đề trầm trọng hơn. Cook cho biết: "Bởi vì chúng ta biết quá ít về quá trình huấn luyện của các hệ thống này, chúng ta thực sự không biết chúng đang nhận được hỗn hợp nội dung nào, hay chúng đang tạo ra những liên tưởng gì."

Nhiếp ảnh ẩm thực thường mang tính cách điệu cao, đầy rẫy các độ tương phản sắc nét, màu sắc rực rỡ, ánh sáng bóng bẩy và hình khối phóng đại. Đôi khi "món ăn" được chụp thậm chí không phải là đồ ăn thật. Meyer cho biết các mô hình AI có thể nắm bắt được những phẩm chất bề mặt và quy luật thị giác này, nhưng lại tái tạo chúng mà không hiểu bối cảnh đằng sau. Meyer nói: "Nói cách khác, việc tạo ảnh bằng AI bắt chước hoàn hảo diện mạo của nhiếp ảnh, nhưng lại không có các chiến lược thẩm mỹ chuyên nghiệp của nó. Cuối cùng, đó chính là điều khiến chúng trở nên vô cùng khó chịu."

Bỏ qua vấn đề phong cách, còn có một vấn đề khác khi học hỏi về thế giới từ việc quét internet: mọi thứ có thể trở nên kỳ lạ rất nhanh. Simon Colton, giáo sư về tính sáng tạo máy tính, trò chơi và trí tuệ nhân tạo tại Đại học Queen Mary ở London, cho biết ví dụ có thể có rất ít hình ảnh về những quả táo đỏ bình thường. "Ai lại muốn đăng bức ảnh một quả táo nhàm chán lên web chứ?"

Trong khi đó, những hình ảnh kỳ lạ hơn có thể thu hút lượng khán giả lớn trên các nền tảng mạng xã hội như Reddit, hoặc lan truyền rộng rãi dưới dạng meme. Những câu chuyện kỳ quặc trên internet và sự suy đồi thông tin (brain rot) đồng nghĩa với việc một mô hình AI có thể sở hữu một tập hợp các liên tưởng kỳ lạ xung quanh thức ăn và vẻ bề ngoài của nó.

Cook cho biết ai cũng biết rằng các hệ thống AI hiện nay cũng đang được huấn luyện trên chính các tài liệu do AI tạo ra. Cook cho biết rất nhiều tài liệu AI phổ biến liên quan đến đồ ăn, và ông nhớ lại xu hướng video do AI tạo ra quay cảnh mọi người nhảy vào hoặc nhảy lên đống thức ăn. Ngoài bản chất đôi khi siêu thực của chính tài liệu đó, nghiên cứu cho thấy việc huấn luyện các mô hình AI bằng đầu ra của các mô hình khác có thể gây ra một dạng "sụp đổ mô hình" (model collapse), hệ quả là sự suy thoái về mặt thị giác và sự tương đồng ngày càng tăng giữa các hình ảnh.

Cách thức hình ảnh được tạo ra và sử dụng thậm chí còn làm cho mọi thứ tồi tệ hơn. Các câu lệnh (prompt) — cả những câu lệnh do người dùng viết lẫn hướng dẫn cấp hệ thống mà các công ty sử dụng để định hướng mô hình của họ — có thể không phải lúc nào cũng mang lại kết quả tốt nhất. Chúng có thể mơ hồ, chẳng hạn như chỉ yêu cầu một chiếc bánh sandwich, hoặc chứa các ngôn từ như "hãy thật chính xác" vốn có ý nghĩa đối với văn bản, nhưng lại không có nhiều ý nghĩa đối với việc tạo ảnh. Các hình ảnh độ phân giải thấp cũng có thể bị phóng to vượt quá kích thước dự định, làm phóng đại mọi sự bất hảo đáng lo ngại vốn có thể đã lọt qua mắt người, hoặc tạo ra một khoảng trống buộc mô hình phải tự điền vào, thường là một cách không hoàn hảo.

Tất cả những điều này đẩy nhiều hình ảnh món ăn do AI tạo ra lọt sâu vào cái bẫy thung lũng kỳ lạ (uncanny valley). Và thật không may cho chúng ta, con người lại sở hữu khả năng nhận biết rất nhạy bén khi nào thức ăn trông có vẻ bất thường. Các nhà khoa học tin rằng cảm giác ghê sợ tiến hóa một phần như một phương tiện bảo vệ chúng ta khỏi ký sinh trùng, mầm bệnh, độc tố và các mối nguy hiểm tiềm ẩn khác, khiến chúng ta đặc biệt nhạy cảm với việc khi nào một thứ gì đó không an toàn để ăn. Califano cho biết điều này khiến thung lũng kỳ lạ đối với thực phẩm trở nên mãnh liệt hơn nhiều so với cảm giác chúng ta trải qua với những thứ giống con người nhưng chưa hoàn hảo.

Thức ăn do AI tạo ra có một khả năng đáng sợ là chạm vào rất nhiều yếu tố kích hoạt đó cùng một lúc. Các phần phụ kỳ lạ giống như sợi mì lại gợi liên tưởng đến giun hoặc ký sinh trùng, các cụm lỗ cho thấy sự nhiễm trùng, và màu sắc lệch lạc...

🔗 Bài gốc (tiếng Anh): Why AI food looks like that
Nguồn: The Verge

Cùng chuyên mục · AI & Dữ liệu
AI & Dữ liệu

Sam Altman xin lỗi vì màn ra mắt GPT-6 Astra hỗn loạn khiến người dùng trả phí bị bỏ lại

OpenAI vừa chính thức ra mắt mô hình GPT-6 Astra nhưng CEO Sam Altman đã phải lên tiếng xin lỗi ngay sau đó vì quy…

The Verge · 4 phút đọc
AI & Dữ liệu

ChatGPT và Claude gặp sự cố gián đoạn hoạt động: Tính toán thời gian chết thực tế

ChatGPT, Claude và Grok vừa đồng loạt gặp sự cố gián đoạn hoạt động trong cùng một ngày. Dữ liệu công khai cho thấy…

Notebookcheck · 6 phút đọc
🚀 VGSNews
AI & Dữ liệu

Vấn đề sự đồng nhất đằng sau những thực đơn tạo bởi AI trông kỳ lạ

Nhiều nhà hàng đang sử dụng hình ảnh thực đơn tạo bằng AI với vẻ ngoài hoàn hảo đến mức khó tả, gây cảm giác khó chịu…

TechCrunch · 7 phút đọc