AI đã deepfake được giọng nói giống người thật và chúng đang chiếm mất việc làm của diễn viên lồng tiếng

24/10/2021 13:00
AI đã deepfake được giọng nói giống người thật và chúng đang chiếm mất việc làm của diễn viên lồng tiếng

Chào mừng bạn đến với kỷ nguyên của những thực tại nhân tạo.

Năm 2019, một vụ lừa đảo xảy ra ở Anh đã làm chấn động giới công nghệ. Không phải vì số tiền bị mất, cũng không phải vì kẻ gian đã chọn một công ty nổi tiếng đế tấn công, mà là vì cách hắn thực hiện nó.

Theo báo cáo từ cảnh sát, nạn nhân của vụ lừa đảo này là CEO của một công ty năng lượng ở Anh. Một ngày, ông ấy nhận được cuộc điện thoại từ sếp của mình, CEO của công ty mẹ tại Đức.

Người đàn ông khẳng định điều đó vì giọng nói phát ra từ điện thoại giống hệt với sếp của ông ấy, từ cách nhấn nhá cho tới âm giọng Đức không lẫn đi đâu được. Đó là những đặc điểm cá nhân mà vị CEO cho rằng không ai có thể giả mạo.

Giọng nói từ điện thoại yêu cầu người đàn ông chuyển 220.000 Euro, tương đương 5,9 tỷ VNĐ vào một tài khoản ở Hungary, nói rằng đó là tiền thanh toán trước cho một dự án. Nạn nhân đã làm theo vì nghĩ đó chính là sếp của mình.

AI đã deepfake được giọng nói giống người thật hơn bao giờ hết, và chúng đang chiếm mất việc làm của diễn viên lồng tiếng - Ảnh 1.

Sự thật là: Tiếng nói phát ra từ đầu dây bên kia chỉ là một sản phẩm giả mạo sử dụng công nghệ "deepfake" giọng nói. Đây là lần đầu tiên công nghệ này được dùng vào mục đích lừa đảo và ngay lập tức nó đã thành công.

Vụ việc được phát hiện sau khi vị CEO người Anh nhận thấy khoản tiền lớn của công ty một đi không trở lại. Ông lập tức báo cảnh sát, những người sau đó nói rằng ông đã đúng: Không ai có thể giả mạo được chất giọng Đức của sếp ông ấy. Nhưng bây giờ, một thuật toán AI đã có thể.

Những giọng nói nhân tạo được làm ra như thế nào?

Giọng nói nhân tạo bây giờ có lẽ không còn quá xa lạ như những ngày đầu tiên chúng xuất hiện. Người dùng điện thoại thông minh đã dần quen thuộc với những trợ lý ảo như Siri, Alexa, người dùng mạng xã hội cũng đã thấy hàng tá video tóm tắt phim được sản xuất đơn giản chỉ bằng cách chuyển văn bản thành giọng nói trên Google Translate.

Nhưng những giọng nói dựa trên công nghệ cũ đó thường rất thô và khô cứng. Chúng gần như chỉ là một giọng đọc đều đều, được tạo ra bằng cách dán từng chữ trong kho từ điển lại với nhau. Không khó để bất kỳ ai, ngay cả một đứa trẻ, nhận ra đó là giọng nói nhân tạo của robot.

Vậy tại sao các ông lớn công nghệ như Google hay Apple không cố gắng làm cho trợ lý ảo của họ tự nhiên hơn? Trên thực tế, họ đã và vẫn đang làm. Có điều đây quả thực là một quá trình thủ công và tốn rất nhiều thời gian.

Sự ra đời của trí tuệ nhân tạo và các thuật toán học sâu (deep learning) bây giờ mới phần nào khiến điều đó trở nên dễ dàng hơn. Nhờ có AI, một số nhà phát triển đã có thể tạo ra những giọng nói thể hiện nhịp độ, cách phát âm hoặc ngữ điệu giống người thật chỉ với vài giờ đào tạo bằng một mẫu giọng nói được thu âm từ trước.

AI đã deepfake được giọng nói giống người thật hơn bao giờ hết, và chúng đang chiếm mất việc làm của diễn viên lồng tiếng - Ảnh 2.

Việc biến giọng nói robot thành giọng nói con người, hoá ra, liên quan đến việc làm cho nó bớt hoàn hảo đi. Trong nhiều năm, các nhà nghiên cứu đã sử dụng ý tưởng cơ bản này để xây dựng các giọng nói ngày một tinh vi hơn.

Ví dụ, tại phòng thí nghiệm của WellSaid, một công ty khởi nghiệp có trụ sở tại Seattle, các kỹ sư đã xây dựng được hai mô hình học sâu chính:

Mô hình đầu tiên có khả năng duyệt qua đoạn văn bản đầu vào để dự đoán các nét bao quát về âm thanh của người nói — bao gồm trọng âm, cao độ và âm sắc. Mô hình thứ hai chỉ làm một nhiệm vụ đơn giản là chèn vào các chi tiết dư thừa trong giọng nói con người như hơi thở, những tiếng vọng hoặc cộng hưởng lại từ phía môi trường.

Bằng cách này, một giọng nói nhân tạo bây giờ có thể được tạo ra giống con người đến nỗi bạn không thể phân biệt được chúng. Các thuật toán có thể được đào tạo để sinh ra giọng nói có đủ nhân tính, từ ngữ âm, chất giọng địa phương, cách ngắt nghỉ cho tới cả tiếng thở.

Tuy nhiên, tạo ra một giọng nói nhân tạo thuyết phục chưa dừng lại ở đó. Một nhiệm vụ quan trọng mà các kỹ sư phải đạt được đó là mô tả lại tính không nhất quán trong lời nói con người. Họ phải xây dựng được một kho biểu cảm, khả năng truyền tải những lời thoại giống nhau theo những phong cách hoàn toàn khác nhau, tùy thuộc vào ngữ cảnh.

WellSaid cho biết điều này chỉ có thể thực hiện được với sự tham gia của những diễn viên lồng tiếng chuyên nghiệp. Vì vậy, họ đã thuê những diễn viên này để tạo ra nhiều mẫu giọng nói đầu vào cho AI học tập. Mất khoảng một vài tuần lao động và tổng cộng các bản thu dài khoảng 2 tiếng để WellSaid tạo ra được các phiên bản giọng nói tổng hợp của họ.

Những nhân vật bạn nghe thấy trong video này không hề có thật, đó là những giọng nói deepfake của WellSaid  

Có tất cả 8 phiên bản giọng đã sẵn sàng được thương mại hóa. WellSaid gọi đó là "tám diễn viên lồng tiếng kỹ thuật số mới". Tobin là một người "luôn tràn đầy năng lượng và sâu sắc". Paige có phong thái "đĩnh đạc và biểu cảm". Ava thì "bóng bẩy, tự tin và chuyên nghiệp".

Giá của những diễn viên lồng tiếng này chắc chắn sẽ rẻ hơn việc bạn thuê một diễn viên ngoài đời, thu âm giọng nói thật của họ trong phòng thu theo một kịch bản được viết trước. Ngoài ra, giọng nói nhân tạo còn có ưu điểm là nó có khả năng cập nhật mọi kịch bản trong thời gian thực, một cơ hội cho vô số những ứng dụng thương mại hóa mới.

Vậy ai sẽ là người sử dụng chúng?

WellSaid và các nhà phát triển giọng nói nhân tạo cho biết có một thị trường rất tiềm năng cho sản phẩm của họ. Đó là các thương hiệu muốn duy trì tương tác âm thanh nhất quán cho hàng triệu lượt khách hàng của mình.

Với sự phổ biến của loa thông minh như ngày nay, cộng thêm sự gia tăng của các đại lý dịch vụ khách hàng tự động, các trợ lý ảo kỹ thuật số được tích hợp trong ô tô và thiết bị thông minh, các thương hiệu có thể cần sản xuất lên tới hàng trăm giờ âm thanh mỗi tháng.

Nhưng họ cũng không còn muốn sử dụng những giọng nói robot được cung cấp bởi công nghệ chuyển văn bản thành giọng nói truyền thống nữa. Đó là bởi những giọng nói này đang ngày càng bị khách hàng phớt lờ và bỏ qua vì tính chất nhàm chán vô cảm.

Rupal Patel, một giáo sư tại Đại học Northeastern, đồng thời là người sáng lập và giám đốc điều hành của VocaliD, một công ty xây dựng giọng nói nhân tạo khác, cho biết: Một hãng pizza tất nhiên không muốn giọng nói họ phát ra giống với hãng pizza đối thủ. Một hãng gà rán hay bán đồ ăn nhanh cũng vậy, họ không thể thuê cùng một người lồng tiếng.

Âm thanh sẽ trở thành một loại nhận diện thương hiệu mới. "Những thương hiệu đã suy nghĩ về màu sắc của họ. Họ đã nghĩ về phông chữ của họ. Bây giờ họ cũng phải bắt đầu suy nghĩ về cách giọng nói của họ phát ra", giáo sư Patel nói.

Nhận diện thương hiệu thậm chí còn có tính địa phương hoá theo từng thị trường và cá nhân hoá tới từng khách hàng. Chẳng hạn như các công ty bây giờ đang phải thuê các diễn viên lồng tiếng khác nhau, tiếng nói của họ ở Đông Bắc Mỹ sẽ khác so với Nam Hoa Kỳ, ở Pháp sẽ khác với Mexico.

Một nền tảng giọng nói AI hứa hẹn sẽ có thể điều chỉnh không chỉ từ ngữ mà cả âm điệu giống với tiếng địa phương. Điều này mở ra khả năng thay đổi quảng cáo trên các nền tảng phát trực tuyến, tùy thuộc vào đặc điểm đối tượng người nghe.

Resemble.ai, một công ty thiết kế giọng nói cho quảng cáo và trợ lý thông minh, cho biết họ đã làm việc với khách hàng để khởi chạy các quảng cáo âm thanh được cá nhân hóa như vậy trên Spotify và Pandora.

Các ngành công nghiệp trò chơi và giải trí cũng đang nhìn thấy lợi ích từ đó. Sonantic, một công ty chuyên về giọng nói nhân tạo có cảm xúc - có thể cười, có thể khóc, thì thầm hoặc hét lên, đang làm việc với các nhà sản xuất trò chơi điện tử và các hãng phim hoạt hình để cung cấp phần lồng tiếng cho các nhân vật của họ.

Nhiều khách hàng của công ty chỉ sử dụng giọng nói nhân tạo trong giai đoạn tiền sản xuất sau đó sẽ chuyển sang diễn viên lồng tiếng thực. Nhưng Sonantic cho biết một số khách hàng đã bắt đầu sử dụng chúng trong sản phẩm cuối cùng, đặc biệt là để thay thế các câu thoại ngắn. Công nghệ của Resemble.ai cũng đặc biệt thích hợp để sửa chữa lỗi phát âm của các diễn viên.

Giọng nói AI đầu tiên có cảm xúc của Sonantic, và nó thậm chí có thể khóc  

Hạn chế lớn nhất mà các công ty phát triển giọng nói nhân tạo đang chạy đua nhau để vượt qua là việc AI chưa thể duy trì tính chân thực trong khoảng thời gian dài. Nghĩa là nó chưa thể tự tạo ra một chương trình podcast hoặc đọc sách nói. Dữ liệu đầu vào và thuật toán cũng chưa đủ thông minh để kiểm soát màn trình diễn như cách mà các đạo diễn hướng dẫn diễn viên của mình.

Zohaib Ahmed, người sáng lập đồng thời là CEO của Resemble.ai, cho biết: "Chúng ta vẫn đang ở trong những ngày đầu của một bài diễn văn nhân tạo". Ông so sánh nó với những ngày đầu mà công nghệ CGI được sử dụng chủ yếu để chỉnh sửa phim ảnh thay vì tạo ra những thế giới hoàn toàn mới từ một màn hình xanh.

Các diễn viên lồng tiếng có sợ bị mất việc?

Tại thời điểm này có lẽ là chưa. Các dự án có tính biểu cảm, sáng tạo và yêu cầu lời thoại dài vẫn được thực hiện tốt nhất bởi con người. Và đối với mỗi giọng nói nhân tạo do các công ty này thực hiện, chính họ cũng cần một diễn viên lồng tiếng để cung cấp dữ liệu đào tạo gốc cho AI của mình.

Nhưng nhìn về tương lai, một số diễn viên đã đang lo lắng về sinh kế của họ. SAG-AFTRA, công đoàn đại diện cho các diễn viên lồng tiếng ở Mỹ, cho biết các thành viên hiện không lo bị AI lấy mất việc làm. Nhưng họ lo lắng về khoản thù lao không công bằng hoặc nguy cơ bị mất quyền kiểm soát giọng nói của mình, những yếu tố cấu thành nên thương hiệu và danh tiếng của họ.

Mới đây, diễn viên lồng tiếng người Canada Bev Standing đã khởi kiện TikTok với cáo buộc tính năng lồng tiếng tích hợp của ứng dụng này sử dụng bản sao giọng nói nhân tạo của cô ấy mà không xin phép.

Trước đó Susan Bennett, diễn viên người Mỹ đã thu âm giọng nói cho trợ lý ảo Siri cũng có một trải nghiệm tương tự. Tại thời điểm cô bắt đầu thu âm giọng nói của mình vào năm 2005, Bennett nghĩ rằng đó chỉ là một dự án nhỏ mà không biết sau này giọng nói của cô sẽ được vang lên trên hàng triệu thiết bị Apple mỗi ngày.

Bởi vậy, một số công ty trong ngành công nghiệp xây dựng giọng nói nhân tạo đang muốn có trách nhiệm hơn. Đại diện của SAG-AFTRA cho biết họ đã chủ động tiếp cận với công đoàn để tìm ra giải pháp tốt nhất để hợp tác lâu dài trên cơ sở tôn trọng các diễn viên lồng tiếng.

Morgan Freeman được tái hiện bằng công nghệ deepfake  

Một số công ty hiện sử dụng mô hình chia sẻ lợi nhuận, nghĩa là họ sẽ trả tiền cho các tác giả giọng nói gốc, mỗi khi khách hàng sử dụng dịch vụ giọng nói ảo của họ. Điều này đã mở ra một lĩnh vực có khả năng đem lại thu nhập thụ động mới.

Một số công ty khác trao quyền cho các diễn viên lồng tiếng tham gia vào dự án thiết kế AI của mình. Các diễn viên được phép giới hạn hoặc từ chối toàn bộ các phương án mà giọng nói của họ được sử dụng.

SAG-AFTRA cũng đang vận động chính sách để bổ sung luật sở hữu giọng nói cho phép các diễn viên bảo vệ nó như một tài sản của mình, nghiêm cấm hoạt động sao chép trái phép giọng nói của họ.

Sẽ vẫn còn một chặng đường dài cần phải đi. Nhưng rõ ràng một khi khoa học công nghệ phát triển, hành lang pháp lý dành cho các công nghệ mới cũng nên được cập nhật kịp thời để bảo vệ quyền lợi chính đáng cho mọi đối tượng trong xã hội. Trường hợp này, bây giờ là giọng nói của những diễn viên lồng tiếng. Nhưng trong tương lai, đó có thể sẽ là giọng nói của mỗi chúng ta.

Pháp luật và bạn đọc


Gửi bình luận
(0) Bình luận
1

Xem phim Sex Education, tôi xấu hổ nhận ra mình chính xác là một bà mẹ "bất bình thường"!

Làm một bậc cha mẹ "bình thường" hóa ra không hề đơn giản như tôi tưởng.
3

Xem Sex Education, tôi khao khát có mối quan hệ như nam chính: Không phải tình yêu nhưng tốt hơn nhiều

Ngoài dự đoán và kỳ vọng, bộ phim giúp tôi nhận ra một khía cạnh hoàn toàn mới.
4

10 lời thoại nhói lòng trong "Khi Cuộc Đời Cho Bạn Quả Quýt": Ai rồi cũng sống như trẻ mồ côi...

Góp phần làm nên thành công của Khi Cuộc Đời Cho Bạn Quả Quýt chính là những câu thoại đầy cảm xúc!
5

Xem phim "Sex Education" tôi hiểu được lý do khiến con hét lên 'con ghét mẹ!'

Nhờ bộ phim này mà mẹ con tôi trở nên hiểu nhau hơn.

Không gia đình - Bài ca tất thắng của giá trị nhân văn cao đẹp

"Không gia đình" là cuốn tiểu thuyết nổi tiếng nhất của văn hào Pháp Hector Malot với giá trị nhân văn đã làm rung động biết bao thế hệ.

Tài tử Alec Baldwin lên tiếng sau tai nạn gây chết người, bản khai nói súng an toàn

Sau vụ nổ súng trên phim trường "Rush" khiến một nữ quay phim tử vong, đạo diễn bị thương ở vai, diễn viên gạo cội Alec Baldwin bày tỏ sự bàng hoàng và thiện chí với gia đình nữ quay phim tử vong.

Hiểm họa khôn lường khi sử dụng súng đạo cụ trong quay phim

Súng đạo cụ thường được sử dụng trong những bộ phim hành động để tạo nên cảm giác chân thực cho người xem nhưng lại tiềm ẩn những tai nạn chết người.

Hồng Ánh làm khách mời của 'Cảnh nóng trên phim: Tại sao và như thế nào?'

Cảnh “nóng” quá tự nhiên chủ nghĩa hiển hiện trên phim sẽ khiến người xem thấy bực bội hơn cái gọi là thưởng thức giá trị hình ảnh.

Rạp xem phim chính thức quay lại, mạng xã hội bùng nổ với lịch chiếu loạt bom tấn!

Phải chăng ngày khán giả Việt có thể ra rạp xem phim đã rất gần kề?

Liên hoan phim Việt Nam 2021 sẽ không có sự kiện thảm đỏ

Ngày 22.10, Bộ VH-TT-DL đã giới thiệu 128 bộ phim sẽ được công chiếu trong Liên hoan phim Việt Nam 2021.

Số phận phim 'Bố già' khi Trấn Thành nằm trong diện rà soát, điều tra từ thiện

Việc Trấn Thành vướng vào ồn ào từ thiện khiến hình ảnh, công việc của anh bị ảnh hưởng khá nhiều. Mới đây, Cục trưởng Cục Điện ảnh cũng đã lên tiếng về ý kiến liệu có nên loại bộ phim “Bố già” khỏi LHP Việt Nam 2021 hay không?

Đạo diễn 'My Name' nói gì về cảnh nóng bị chê nặng 'đô' trong phim?

Cảnh nóng khá trần trụi giữa nữ diễn viên Han So Hee và Ahn Bo Hyun trong bộ phim hành động "My Name" phải đối mặt với những phản ứng trái chiều từ người xem.

Nhạc sĩ Lư Nhất Vũ qua đời

Giải trí - Tiểu Vũ - 29/03/2025 13:37
Nhạc sĩ Lư Nhất Vũ, một trong những cây đại thụ của nền âm nhạc Việt Nam đã tạ thế vào ngày 29.3. Ông đã để lại một di sản âm nhạc vô giá gắn liền với lịch sử văn hóa đất nước.

Xem xét 17 gia đình có con bị bắt cóc, tôi nhận ra rằng họ đều bỏ qua 5 lỗ hổng chết người sau

Kỹ năng - Hiểu Đan - 29/03/2025 13:00
Đến tận bây giờ, vẫn còn nhiều gia đình đang đau đáu tìm kiếm con mình. Nhiều phụ huynh khóc lóc, hối hận vô cùng vì bỏ qua những lổ hổng này!

"Mẹ ơi, chúng ta không được đi khoang hạng nhất vì nghèo sao?" - Câu trả lời của bà mẹ xứng đáng đưa vào sách giáo khoa

Suy ngẫm - Hiểu Đan - 29/03/2025 12:00
Trên chuyến bay trở về nhà sau dịp Tết Nguyên đán, đứa trẻ hỏi 1 câu khiến bà mẹ có phần lúng túng.

Nhà địa tâm lý học giải thích: Tại sao sân bay cũng được coi là địa điểm tâm linh?

Thư giãn - Thanh Long - 29/03/2025 11:00
Một số chuyến bay từ múi giờ cao về múi giờ thấp có thể hạ cánh trước cả giờ khởi hành. Điều này rõ ràng đem lại cảm giác bạn đang du hành ngược trở về quá khứ.

Cha đẻ phần mềm Unikey: Từng nhận bão dư luận khi ra mắt ‘‘bộ gõ quốc dân’’

Phong cách sống - Khuê Hiền - 29/03/2025 10:00
Tại thời điểm Unikey mới được ra mắt, ông Phạm Kim Long đã nhận về nhiều ý kiến trái chiều khi cung cấp phần mềm này miễn phí.

Xem lại Na Tra: Số mệnh chưa bao giờ là điều không thể thay đổi!

Điện ảnh - Đông - 29/03/2025 09:00
Người cha nghiệm ra được triết lý đáng suy ngẫm này.

Đường vào Thiền - Osho lật ngược khái niệm Thiền: Bạn đã hiểu sai như thế nào?

Từ sách - Phim - Minh Hằng - 29/03/2025 08:00
Đường vào thiền không đưa ra các kỹ thuật cụ thể để người đọc làm theo một cách máy móc. Thay vào đó, Osho hé mở một cánh cửa để chúng ta bước vào hành trình khám phá chính mình thông qua những câu chuyện, chỉ dẫn gần gũi và thiết thực.

Chi phí hẹn hò ngày càng cao, nhiều người “quay xe” quen búp bê người lớn

Suy ngẫm - Trang Đào - 28/03/2025 12:00
Chi phí tương tác ngoài đời thực ngày càng cao cũng là lý do khiến cho "bạn gái AI" đã trở thành lựa chọn tiết kiệm. Một nhà đầu tư thẳng thắn nói: "Những gì chúng tôi bán không phải là silicon, mà là thuốc giảm đau để chống lại sự cô đơn".

ChatGPT thêm tính năng chỉnh sửa ảnh dễ hơn, tạo biểu đồ và infographic cho công việc tốt hơn

Kỹ năng - Sơn Vân - 28/03/2025 11:00
Các tính năng mới này có sẵn cho cả người dùng ChatGPT miễn phí và trả phí thông qua mô hình GPT-4o của OpenAI.

Vì sao có nhiều cô gái biết tình yêu độc hại, "red flag" tứ tung vẫn "đâm đầu" vào bằng được để chịu tổn thương?

Phong cách sống - Chi Chi - 28/03/2025 10:00
Tình yêu và cách con người yêu từ lâu vẫn là một bài toán không thể giải mã hoàn toàn.

10 lời thoại nhói lòng trong "Khi Cuộc Đời Cho Bạn Quả Quýt": Ai rồi cũng sống như trẻ mồ côi...

Điện ảnh - Van Nguyen - 28/03/2025 09:00
Góp phần làm nên thành công của Khi Cuộc Đời Cho Bạn Quả Quýt chính là những câu thoại đầy cảm xúc!

Podcast: Đường vào thiền - Yêu là con đường sử dụng tình dục một cách sáng tạo

Từ sách - Phim - 28/03/2025 08:30
Quá trình chuyển hóa, thăng hoa năng lượng tình dục chỉ có thể xảy ra thông qua tình yêu. Đây là lý do tại sao thật vô ích khi cố kìm nén tình dục. Nếu kìm nén, năng lượng tình dục bị kìm nén sẽ gây nên tình trạng mất trí; nó sẽ gây ra các chứng bệnh tâm thần.

Đường vào thiền - Yêu là cho đi, điều gì bạn nhận được đều là phúc lành

Từ sách - Phim - Quang Thanh - 28/03/2025 08:00
Trên thế gian chỉ có hai kiểu người: những người đau khổ vì tình dục và những người biến năng lượng tình dục thành tình yêu.

Chủ tịch Alibaba nêu những thứ siêu AI không thể có, hoài nghi về robot hình người

Suy ngẫm - Sơn Vân - 27/03/2025 15:00
Phát biểu tại sự kiện Jumpstarter của gã khổng lồ thương mại điện tử Alibaba ở Hồng Kông (Trung Quốc), Chủ tịch Thái Sùng Tín cho rằng phần lớn những giá trị con người trân trọng không được phản ánh trong dữ liệu huấn luyện AI.

Sống an vui - Liệu có cách nào để tìm thấy bình yên giữa cuộc đời?

Từ sách - Phim - Minh Hằng - 27/03/2025 14:00
“Sống an vui” của Khangser Rinpoche xuất hiện như một người bạn đồng hành, giúp ta tìm lại sự bình an trong tâm hồn.
HẠT GIỐNG TÂM HỒN
2019 Bản quyền thuộc về hatgiongtamhon.com.vn. Phát triển bởi ONECMS
Thứ 7, 29/03/2025