Veo 3 text to speech: cách thêm lồng tiếng và thuyết minh cho video (2026)

Thêm lồng tiếng, thuyết minh cho video Veo 3 bằng chuyển văn bản thành giọng nói: cấu trúc prompt, ví dụ chép là dùng, tính thời lượng, điều khiển giọng, kiểm tra chất lượng.

E

Emma Chen · 19 min read · Jun 26, 2026

Veo 3 text to speech: cách thêm lồng tiếng và thuyết minh cho video (2026)

Quy trình chuyển văn bản thành giọng nói và lồng tiếng với Veo 3

Hầu hết mọi người biết đến Veo 3 như một mô hình tạo video từ văn bản: bạn mô tả một cảnh và nhận về hình ảnh chuyển động. Nhưng tính năng âm thầm thay đổi quy trình làm việc lại là chuyển văn bản thành giọng nói (text to speech). Veo 3 có thể tạo lời lồng tiếng hoặc lời thuyết minh trên màn hình ngay trong cùng clip dựng hình ảnh, với lời nói canh theo hành động và chuyển động miệng khớp với câu thoại. Không cần công cụ giọng nói riêng, không cần lượt đồng bộ thủ công, không phải ghép âm thanh lên cảnh quay câm trong trình dựng.

Điều đó thay đổi cách bạn nên lên kế hoạch cho một video. Thay vì viết prompt hình ảnh rồi gắn âm thanh vào sau, bạn viết câu thoại, hình ảnh và cách thể hiện thành một chỉ dẫn duy nhất. Làm tốt, kết quả có cảm giác như một sản phẩm hoàn chỉnh (video giải thích, quảng cáo, demo sản phẩm, một nhịp phim tài liệu) ngay khi ra khỏi mô hình. Làm cẩu thả, giọng sẽ lệch, thời lượng trượt, hoặc lời nói nghe phẳng lì.

Bài viết này chỉ chính xác cách thêm lồng tiếng và thuyết minh vào video Veo 3: hai chế độ thể hiện, cấu trúc prompt hiệu quả, các ví dụ chép là dùng cho những trường hợp phổ biến nhất, phép tính thời lượng để giữ lời nói gọn trong một clip 8 giây, và danh sách kiểm tra chất lượng để bạn bắt lỗi trước khi đăng. Nếu muốn xem bức tranh âm thanh rộng hơn trước, hướng dẫn prompt âm thanh gốc của Veo 3 của chúng tôi bao quát hội thoại, hiệu ứng âm thanh và nhạc cùng nhau; bài này đi sâu vào trường hợp có nhiều yêu cầu nhất: có một giọng nói sạch phủ lên cảnh quay.

Thuyết minh, hội thoại và lồng tiếng: hiểu đúng thuật ngữ trước

Veo 3 xử lý lời nói theo vài cách khác nhau, và chọn sai cách là lý do phổ biến nhất khiến một prompt thất bại.

  • Thuyết minh trên màn hình (khớp khẩu hình): một nhân vật xuất hiện trong hình nói trực tiếp với máy quay. Mô hình tạo chuyển động miệng khớp với lời nói. Dùng cho video giải thích kiểu talking head (người nói trực diện trước máy quay), phần mở đầu của người dẫn chương trình, lời chứng thực kiểu UGC và clip phỏng vấn đường phố.
  • Lồng tiếng (ngoài màn hình): giọng của người thuyết minh vang lên trên những hình ảnh không có ai nói trước máy quay: cảnh sản phẩm, b-roll, phong cảnh, bản quay màn hình dựng lại thành cảnh. Giọng nói không gắn với người nào trong hình; không có miệng nào để khớp.
  • Hội thoại: hai nhân vật trở lên nói chuyện với nhau. Đây là một mảng riêng (gán lời thoại cho đúng người, tạo tương phản giọng nói, nhịp phản ứng) và chúng tôi đã trình bày đầy đủ trong hướng dẫn hội thoại hai nhân vật. Nếu kịch bản có những câu thoại qua lại, hãy bắt đầu từ đó.

Chuyển văn bản thành giọng nói theo nghĩa mà đa số người sáng tạo muốn nói ("tôi có sẵn kịch bản, tôi muốn có một giọng đọc nó trên video") tương ứng với lồng tiếng hoặc thuyết minh trên màn hình. Phần còn lại của bài tập trung vào hai loại này, vì đó là thứ mọi người tìm kiếm khi gõ "veo 3 text to speech" hoặc "veo 3 voiceover."

Quy tắc thực tế: nếu khán giả cần thấy khẩu hình tạo thành từng từ, bạn cần thuyết minh khớp khẩu hình và phải mô tả người nói trước máy quay. Nếu khán giả chỉ cần nghe lời nói, bạn cần lồng tiếng và mô tả giọng nói mà không đưa một khuôn mặt đang nói vào khung hình.

Cách Veo 3 tạo giọng nói từ prompt

Veo 3 không có trường "giọng nói" riêng. Câu thoại nằm ngay trong cùng prompt ngôn ngữ tự nhiên với mọi thứ khác. Mô hình đọc prompt, quyết định ai đang nói (hoặc giọng nói có ở ngoài màn hình hay không), tạo ra một giọng phù hợp với mô tả và dựng âm thanh đồng bộ chặt chẽ với video. Để tìm hiểu sâu hơn về cơ chế bên dưới, hãy xem cách Veo 3 tạo âm thanh hoạt động.

Từ thiết kế đó rút ra 3 điều, và chúng chi phối mọi kỹ thuật bên dưới:

  1. Những từ chính xác bạn muốn nói phải nằm trong dấu ngoặc kép. Bất cứ thứ gì đặt trong ngoặc kép, Veo 3 coi là câu thoại nguyên văn cần đọc. Bất cứ thứ gì ngoài ngoặc kép là chỉ dẫn: giọng điệu, nhịp độ, accent, ai đang nói. Giữ hai phần này tách bạch là thói quen có đòn bẩy cao nhất.
  2. Bản sắc của giọng nói đến từ mô tả, không phải từ một giọng cài sẵn. Bạn nhận được đúng giọng mà bạn mô tả: độ tuổi, giới tính, accent, độ ấm, năng lượng, nghề nghiệp. Mô tả mơ hồ ("một giọng dễ nghe") cho kết quả không nhất quán giữa các lần render. Mô tả cụ thể ("một người phụ nữ điềm tĩnh ở độ tuổi 30, giọng ấm quãng trung, thong thả") tái tạo ổn định hơn nhiều.
  3. Lời nói phải chia sẻ chỗ với thời lượng clip. Một clip 8 giây chỉ chứa được một số từ nhất định. Nếu viết câu thoại quá dài, Veo 3 hoặc đọc vội, hoặc cắt mất phần cuối. Cách khắc phục là đếm từ trước khi render, và chúng tôi sẽ nói về việc này ở phần thời lượng.

Cấu trúc prompt lồng tiếng hiệu quả

Sau hàng trăm lượt tạo, cấu trúc cho giọng nói sạch ổn định nhất gồm 5 phần theo thứ tự. Không phải prompt nào cũng cần đủ cả 5 phần, nhưng thứ tự này giúp mô hình không nhầm chỉ dẫn với lời thoại.

  1. Cảnh / hình ảnh: những gì ta nhìn thấy.
  2. Định nghĩa người nói: ai đang nói, trên hay ngoài màn hình, được mô tả cụ thể.
  3. Câu thoại, đặt trong ngoặc kép: nguyên văn lời nói.
  4. Chỉ dẫn cách thể hiện: giọng điệu, nhịp độ, cảm xúc, accent, điểm nhấn.
  5. Môi trường âm thanh: âm thanh nền hoặc "lồng tiếng sạch, không nhạc nền" để giọng nói luôn rõ.

Đây là bộ khung:

[Cảnh quay]. [Người nói: người thuyết minh trên màn hình hoặc ngoài màn hình, được mô tả cụ thể].
Người thuyết minh nói: "[câu thoại chính xác]."
Cách thể hiện: [giọng điệu, nhịp độ, accent, điểm nhấn].
Âm thanh: [lồng tiếng sạch / âm thanh nền nhẹ], giọng rõ và nổi lên phía trước trong bản mix.

Một ví dụ điền cụ thể cho phần lồng tiếng sản phẩm ngoài màn hình:

Máy quay tiến chậm vào một chiếc tai nghe nhét tai không dây màu đen nhám xoay trên bệ được chiếu sáng dịu,
độ sâu trường ảnh nông, ánh sáng sản phẩm cao cấp.
Người thuyết minh ngoài màn hình, người đàn ông điềm tĩnh cuối 30 tuổi, giọng ấm quãng trung, giọng Mỹ.
Người thuyết minh nói: "Mười hai giờ phát nhạc. Một lần sạc. Không đánh đổi."
Cách thể hiện: tự tin, thong thả, ngắt nhẹ trước "Không đánh đổi."
Âm thanh: lồng tiếng sạch, không nhạc, giọng nổi phía trước và gần gũi.

Và một phiên bản khớp khẩu hình trên màn hình, nơi người nói xuất hiện trong hình:

Trung cận cảnh một nữ barista thân thiện, cuối 20 tuổi, đứng sau quầy quán cà phê,
ánh sáng buổi sáng, tiếng ồn nền nhẹ của quán.
Cô nhìn vào máy quay và nói, khẩu hình khớp với lời cô nói.
Cô nói: "Nói thật nhé? Đây là ly cold brew êm nhất mà chúng tôi từng pha."
Cách thể hiện: ấm áp, thoải mái, nụ cười chân thật, nhịp độ trò chuyện.
Âm thanh: âm thanh quán cà phê nhẹ phía dưới giọng chính rõ ràng.

Hãy để ý khác biệt: ví dụ ngoài màn hình không bao giờ đưa khuôn mặt đang nói vào cảnh, nên không có gì để khớp khẩu hình và giọng nói nghe như lời thuyết minh. Ví dụ trên màn hình ghi rõ "khẩu hình khớp với lời cô nói", điều này bảo Veo 3 tạo chuyển động môi. Phân biệt đúng điểm này là ranh giới giữa một kết quả sạch và một video có giọng nói lơ lửng trên người mà môi không hề cử động, hoặc tệ hơn, một cảnh sản phẩm có cái miệng ma dường như đang nói.

8 trường hợp sử dụng thực tế, kèm prompt chép là dùng

Đây là những công việc lồng tiếng và thuyết minh có nhu cầu cao nhất mà mọi người thực sự mang đến Veo 3. Mỗi prompt đều sẵn sàng để điều chỉnh: đổi chủ thể, giữ nguyên cấu trúc.

1. Lồng tiếng quảng cáo sản phẩm (ngoài màn hình)

Các cận cảnh điện ảnh của một chiếc bình nước inox đặt trên tảng đá ướt bên dòng suối,
ánh sáng viền lúc mặt trời mọc, chuyển động dolly chậm.
Người thuyết minh ngoài màn hình, người phụ nữ ở độ tuổi 30, ấm áp và vững vàng, giọng neutral American.
Người thuyết minh nói: "Sinh cho đường mòn. Hợp mọi ngày."
Cách thể hiện: gợi khát vọng, điềm tĩnh, nhịp đều.
Âm thanh: lồng tiếng sạch, tiếng suối khẽ ở nền, không nhạc.

2. Thuyết minh video giải thích / cách hoạt động

Cảnh phong cách hoạt hình gọn gàng: một gói dữ liệu phát sáng chạy dọc đường mạng
giữa hai máy chủ cách điệu, bảng màu xanh dịu.
Người thuyết minh ngoài màn hình, người đàn ông ở độ tuổi 40, rõ ràng và mang tính hướng dẫn, giọng trung tính.
Người thuyết minh nói: "Khi bạn bấm gửi, tin nhắn được chia thành các gói và định tuyến
qua con đường nhanh nhất hiện có."
Cách thể hiện: rõ ràng, chừng mực, như giáo viên giảng bài, không vội.
Âm thanh: lồng tiếng sạch, tiếng ù nền khẽ, giọng nổi phía trước.

3. Phần mở đầu của người dẫn chương trình kiểu talking head (trên màn hình, khớp khẩu hình)

Trung cảnh một người dẫn chương trình nam tự tin, đầu 30 tuổi, trong studio hiện đại với ánh sáng
chủ đạo mềm và nền bokeh mờ. Anh nhìn thẳng vào máy quay, khớp khẩu hình.
Anh nói: "Chào mừng bạn quay lại. Hôm nay chúng ta sẽ bóc tách ba điều không ai nói với bạn
về năm đầu tiên làm freelance."
Cách thể hiện: tươi tắn, thân thiện, phát âm rõ ràng, cử chỉ tay tự nhiên và sôi nổi.
Âm thanh: âm thanh studio sạch, giọng chính sắc nét.

4. Lời chứng thực kiểu UGC (trên màn hình)

Cảnh selfie dọc cầm tay của một phụ nữ cuối 20 tuổi đang đi trên con phố thành phố đầy nắng,
trang phục giản dị, ánh sáng tự nhiên, khớp khẩu hình với lời nói.
Cô nói: "Lúc đầu tôi cũng hoài nghi, nhưng được 3 tuần rồi và giấc ngủ của tôi thực sự tốt hơn."
Cách thể hiện: thẳng thắn, hơi hào hứng, như đang trò chuyện, chân thật.
Âm thanh: tiếng đường phố nhẹ phía dưới giọng nói rõ, thu gần micro.

5. Thuyết minh phim tài liệu / điện ảnh

Cảnh quay trên không bao quát một dãy núi mù sương lúc bình minh, trôi chậm, màu lạnh trầm.
Người thuyết minh ngoài màn hình, người đàn ông lớn tuổi, cuối 50 tuổi, giọng trầm vang, giọng refined British.
Người thuyết minh nói: "Suốt mười nghìn năm, những đỉnh núi này vẫn giữ sự tĩnh lặng của mình."
Cách thể hiện: chậm, nặng ký, trang trọng, ngắt nghỉ dài.
Âm thanh: lồng tiếng sạch, gió khẽ, không gian điện ảnh quanh giọng nói.

6. Lồng tiếng demo kiểu màn hình ứng dụng / SaaS

Bản dựng cách điệu của giao diện bảng điều khiển gọn gàng hiện dần lên, con trỏ lướt qua,
các thẻ trượt vào, giao diện hiện đại sáng sủa.
Người thuyết minh ngoài màn hình, người phụ nữ ở độ tuổi 30, thân thiện và hiệu quả, giọng trung tính.
Người thuyết minh nói: "Kéo bất kỳ tác vụ nào để đổi lịch. Cả tuần của bạn cập nhật ngay tức thì."
Cách thể hiện: hữu ích, nhanh nhẹn nhưng rõ ràng, nhiệt tình nhẹ nhàng.
Âm thanh: lồng tiếng sạch, vài tiếng click giao diện nhẹ, không có lớp nhạc nền.

7. Hook mạng xã hội / câu mở đầu video ngắn (trên màn hình)

Cận cảnh dồn dập một chàng trai trẻ trong căn bếp sáng sủa đang giơ cao chiếc cốc cà phê, năng lượng
nhanh, khớp khẩu hình, khung hình dọc.
Anh nói: "Đừng mua cold brew đắt tiền nữa. Đây là cách làm nó chỉ với vài đồng lẻ."
Cách thể hiện: năng lượng cao, nhanh, thu hút sự chú ý, nhấn mạnh thật mạnh vào từ "đừng."
Âm thanh: giọng chính sạch, âm thanh phòng gọn.

8. Thuyết minh đa ngôn ngữ / có accent

Cảnh lia chậm thanh lịch qua quầy bánh ngọt kiểu Paris, ánh sáng ấm từ cửa sổ,
những chiếc bánh vàng óng.
Người thuyết minh ngoài màn hình, người phụ nữ ở độ tuổi 30, soft French-accented English, giọng thân mật.
Người thuyết minh nói: "Mỗi buổi sáng, bơ, bột, sự kiên nhẫn — mọi thứ lại bắt đầu."
Cách thể hiện: dịu dàng, giàu cảm giác, thong thả.
Âm thanh: lồng tiếng sạch, âm thanh quán cà phê khẽ ở nền.

Với nội dung đa ngôn ngữ, hãy gọi tên accent thật cụ thể, ví dụ "soft French-accented English" (tiếng Anh pha giọng Pháp nhẹ), "neutral American" (giọng Mỹ trung tính) hay "refined British" (giọng Anh tinh tế), thay vì chỉ ghi "nước ngoài". Nếu muốn câu thoại nói hoàn toàn bằng ngôn ngữ khác, hãy viết câu thoại bằng ngôn ngữ đó trong ngoặc kép và nêu ngôn ngữ trong phần chỉ dẫn, nhưng luôn nghe lại kết quả, vì chất lượng giọng nói ngoài tiếng Anh biến động nhiều hơn tiếng Anh.

Thời lượng: đặt vừa lời thoại trong clip

Đây là chỗ phần lớn bản lồng tiếng bị hỏng. Clip Veo 3 ngắn, và lời thuyết minh tự nhiên chạy ở mức khoảng 2 đến 3 từ mỗi giây để cách đọc rõ ràng, chậm hơn với phong cách điện ảnh, nhanh hơn với phong cách sôi động. Từ đó bạn có một "ngân sách" dùng được:

  • Clip 8 giây: khoảng 16–22 từ lời nói để nhịp độ thoải mái, tối đa khoảng 26 từ nếu đọc nhanh.
  • 6 giây lời nói (chừa chỗ để thở): khoảng 12–18 từ.

Hãy đếm số từ trong câu thoại đặt trong ngoặc kép trước khi render. Nếu vượt ngân sách, bạn có 3 lựa chọn: cắt bớt từ, chia kịch bản ra nhiều clip, hoặc chấp nhận cách đọc nhanh hơn. Ví dụ quảng cáo sản phẩm ở trên ("Sinh cho đường mòn. Hợp mọi ngày.") dài 7 từ, nên vẫn còn chỗ cho một nhịp lặng, đúng thứ mà một quảng cáo cao cấp cần.

Khi kịch bản thực sự cần nhiều lời nói hơn sức chứa của một clip, hãy tạo từng câu thành một clip riêng rồi ghép lại, hoặc dùng tính năng kéo dài clip để tiếp nối một cảnh. Hướng dẫn kéo dài video Veo 3 vượt quá 8 giây của chúng tôi chỉ cách giữ giọng nói và cảnh nhất quán qua các cú cắt. Hãy lên kế hoạch kịch bản thành chuỗi những câu ngắn, tự đủ nghĩa thay vì một đoạn dài, và cách làm nhiều clip sẽ có cảm giác chủ đích thay vì bị chặt vụn.

Một ví dụ tính toán đơn giản. Giả sử toàn bộ lời thuyết minh là: "Loa Aurora mới. Âm thanh tràn phòng. Pin dùng cả ngày. Và nó hòa vào mọi căn phòng." Đó là 18 từ, ở ngưỡng giới hạn của một clip 8 giây với nhịp điềm tĩnh. Bạn hoặc tách thành 2 clip (câu thứ nhất: hai câu đầu; câu thứ hai: hai câu cuối), hoặc đọc nhanh hơn một chút và giữ nguyên trong 1 clip. Đếm trước biến trò đoán mò thành một quyết định.

Điều khiển giọng nói: giọng điệu, accent, nhịp độ và điểm nhấn

Câu thoại trong ngoặc kép quyết định nói gì. Mọi thứ còn lại trong prompt quyết định nói thế nào. Những đòn bẩy này tác động đến kết quả nhiều nhất:

  • Độ tuổi và giới tính định hình âm sắc. "Người đàn ông cuối 50 tuổi" nghe hoàn toàn khác "người đàn ông ở độ tuổi 20". Hãy luôn nêu cả hai.
  • Accent (giọng vùng miền) là công cụ điều khiển mạnh và đáng tin cậy. "Neutral American" (giọng Mỹ trung tính), "refined British" (giọng Anh tinh tế), "soft Australian" (giọng Úc nhẹ nhàng) và "warm Southern US" (giọng miền Nam nước Mỹ ấm áp) đều cho ra những giọng riêng biệt, lặp lại được. Từ ngữ mơ hồ chỉ cho ra giọng mơ hồ.
  • Năng lượng và giọng điệu (điềm tĩnh, tự tin, hào hứng, trang trọng, nhanh nhẹn, thân mật) quyết định cảm xúc truyền tải. Hãy khớp với từng trường hợp sử dụng: quảng cáo cần sự gợi khát vọng, video giải thích cần sự rõ ràng, phim tài liệu cần sức nặng.
  • Nhịp độ (thong thả, chừng mực, nhanh, dồn dập) tương tác trực tiếp với ngân sách từ. Nhịp nhanh cho bạn thêm vài từ; nhịp điện ảnh chậm tốn của bạn vài từ.
  • Điểm nhấn và quãng ngắt — hãy chỉ rõ những khoảnh khắc cụ thể: "ngắt nhẹ trước câu cuối", "nhấn mạnh từ 'miễn phí'", "để từ cuối cùng thấm vào". Những vi chỉ dẫn này khiến lồng tiếng nghe như được đạo diễn chứ không phải chỉ đọc cho xong.

Nếu muốn cùng một người thuyết minh xuyên suốt nhiều clip (một series, một quảng cáo nhiều phần, một chuỗi video giải thích nhiều tập), hãy giữ mô tả giọng nói giống hệt, từng từ một, trong mọi prompt. Tính nhất quán của giọng nói hoạt động theo cùng nguyên lý với tính nhất quán của nhân vật về hình ảnh: mô hình tái tạo những gì bạn lặp lại. Các kỹ thuật trong hướng dẫn giữ nhân vật đồng nhất của chúng tôi áp dụng cho giọng nói cũng như cho khuôn mặt. Hãy lưu mô tả người thuyết minh thành một khối dùng lại được và dán nguyên văn.

Giữ giọng nói sạch trong bản mix

Một phàn nàn phổ biến là giọng nói bị chìm dưới nhạc hoặc âm thanh nền do mô hình tạo. Hai thói quen khi viết prompt giúp tránh điều này:

  1. Nêu rõ bản mix. Thêm "giọng nổi rõ phía trước", "lồng tiếng sạch, không nhạc" hoặc "giọng chính nằm trên âm thanh nền". Nếu không, Veo 3 đôi khi tạo một lớp nhạc nền cạnh tranh với lời thuyết minh.
  2. Chủ động với âm thanh nền. Một chút tiếng phòng hoặc âm thanh môi trường của địa điểm khiến lồng tiếng có cảm giác thật. Quá nhiều sẽ nhấn chìm nó. Với thuyết minh thuần túy, "lồng tiếng sạch, không nhạc nền" là mặc định an toàn nhất; chỉ thêm âm thanh nền khi cảnh đòi hỏi, và giữ ở mức "khẽ" hoặc "nhẹ".

Nếu bạn định tự thêm nhạc hoặc thiết kế âm thanh ở khâu hậu kỳ, hãy yêu cầu một giọng khô, sạch với âm thanh nền tối thiểu để có một stem sạch để làm việc. Nếu muốn clip dùng được luôn sau khi ra khỏi mô hình, hãy để Veo 3 tạo âm thanh nền nhẹ nhưng giữ giọng nổi phía trước.

Danh sách kiểm tra chất lượng trước khi đăng

Hãy cho mọi clip lồng tiếng chạy qua danh sách này. Nó bắt được những lỗi vốn rất rõ một khi bạn biết cần nhìn vào đâu.

  • Lời khớp kịch bản. Nghe trọn câu thoại. Thỉnh thoảng Veo 3 bỏ sót hoặc đổi một từ, nhất là gần cuối một clip chật. Nếu vậy, hãy rút gọn câu thoại hoặc render lại.
  • Khớp khẩu hình (chỉ với trên màn hình). Quan sát miệng. Nếu môi và lời lệch nhau, có thể prompt chưa ghi "khớp khẩu hình", hoặc câu thoại quá dài so với clip. Lồng tiếng ngoài màn hình không có miệng để kiểm tra, hãy xác nhận không có khuôn mặt đang nói vô tình lọt vào khung hình.
  • Giọng đúng yêu cầu. Đúng độ tuổi, giới tính, accent, năng lượng chưa? Nếu lệch, hãy mô tả cụ thể và rõ ràng hơn.
  • Nhịp độ vừa vặn. Không kết thúc vội, không có khoảng lặng gượng gạo. Điều chỉnh số từ hoặc chỉ dẫn về nhịp độ.
  • Bản mix sạch. Giọng nói nằm rõ trên âm thanh nền. Không có nhạc cạnh tranh trừ khi bạn chủ ý.
  • Không có artifact. Lắng nghe tiếng rung như robot, phụ âm bị cụt hoặc tiếng thở lạ. Render lại cùng prompt thường sửa được một lần tạo xấu đơn lẻ.
  • Accent không bị trượt. Qua nhiều clip trong một series, hãy xác nhận accent và âm sắc của người thuyết minh vẫn nhất quán.

Nếu một clip lỗi về lời hoặc về độ khớp, cách sửa nhanh nhất hầu như luôn là rút ngắn câu thoại trong ngoặc kép. Độ dài là nguyên nhân gốc của phần lớn vấn đề về lời nói trong Veo 3.

Lỗi thường gặp và cách khắc phục

  • Đặt câu thoại ngoài ngoặc kép. Nếu các từ không nằm trong dấu ngoặc kép, Veo 3 có thể coi chúng là mô tả và không nói gì cả, hoặc nói một bản diễn đạt lại. Hãy luôn đặt câu thoại nguyên văn trong ngoặc kép.
  • Trộn chỉ dẫn vào trong ngoặc kép. Viết "nói hào hứng: mua ngay" có thể khiến mô hình đọc luôn cụm "nói hào hứng". Hãy để chỉ dẫn bên ngoài ngoặc kép; bên trong chỉ để lời được nói.
  • Viết câu thoại quá dài. Lỗi số một. Hãy đếm từ so với ngân sách của clip mỗi lần.
  • Mô tả giọng mơ hồ. "Một giọng tốt" cho bạn một giọng khác ở mỗi lần render. Hãy chốt rõ bằng độ tuổi, giới tính, accent và giọng điệu.
  • Quên chỉ dẫn về bản mix. Dẫn đến nhạc nhấn chìm lời thuyết minh. Hãy thêm "giọng nổi phía trước, lồng tiếng sạch".
  • Mong chờ một khuôn mặt đang nói mà bạn chưa mô tả. Lồng tiếng ngoài màn hình theo thiết kế không có người nói trước máy quay. Nếu muốn khớp khẩu hình, bạn phải đưa một người nói đã mô tả sẵn vào khung hình và ghi rõ môi khớp với lời.

So sánh lồng tiếng của Veo 3 với công cụ TTS riêng

Bạn luôn có thể tạo hình ảnh trong Veo 3 rồi thêm giọng nói bằng một công cụ chuyển văn bản thành giọng nói (TTS) chuyên dụng sau đó. Đôi khi đó là lựa chọn đúng: với kịch bản rất dài, với một giọng có cấp phép cụ thể, hoặc khi bạn cần kiểm soát biên tập chính xác từng âm tiết.

Nhưng tạo giọng nói gốc thắng ở 3 mặt quan trọng với phần lớn nội dung ngắn và quảng cáo. Thứ nhất, Veo 3 xử lý giúp bạn thời lượng và độ khớp: giọng nói đã khớp với hành động và, với người nói trên màn hình, khớp với đôi môi. Thứ hai, giọng nói thuộc về cảnh: âm học, tiếng phòng và năng lượng của nó khớp với hình ảnh thay vì nghe như bị dán vào. Thứ ba, chỉ cần một bước: không xuất file, không nhập lại, không căn chỉnh thủ công. Với một quảng cáo 8 giây hay một hook mạng xã hội, cách dùng giọng gốc thường nhanh và liền mạch hơn. Với một phim tài liệu thuyết minh dài 5 phút, một lượt TTS chuyên dụng trên b-roll đã ghép có thể cho bạn nhiều quyền kiểm soát hơn. Hãy chọn theo độ dài và mức độ chính xác biên tập bạn cần.

Tổng hợp: quy trình lồng tiếng

Một quy trình lặp lại được để có một clip lồng tiếng hoàn chỉnh:

  1. Chọn chế độ: lồng tiếng ngoài màn hình hay thuyết minh khớp khẩu hình trên màn hình. Lựa chọn này chi phối toàn bộ prompt.
  2. Viết câu thoại trước, rồi đếm. Giữ trong ngân sách từ của độ dài clip. Cắt thẳng tay.
  3. Mô tả giọng nói cụ thể: độ tuổi, giới tính, accent, giọng điệu, và lưu khối đó nếu bạn sẽ dùng lại người thuyết minh.
  4. Ghép prompt theo thứ tự 5 phần: cảnh, người nói, câu thoại trong ngoặc kép, cách thể hiện, bản mix âm thanh.
  5. Render, rồi kiểm tra chất lượng theo danh sách: lời, độ khớp, giọng, nhịp độ, bản mix.
  6. Xử lý độ dài trước khi có gì hỏng; đó thường là thủ phạm.
  7. Với kịch bản dài hơn, nối các clip: mỗi clip một câu, và giữ mô tả giọng nói giống hệt nhau giữa chúng.

Vòng lặp đó biến "veo 3 text to speech" từ một prompt một dòng đầy hy vọng thành một phương pháp sản xuất đáng tin cậy. Hãy bắt đầu từ một trong 8 mẫu ở trên, thay câu thoại riêng vào, đếm từ rồi render. Với bộ công cụ âm thanh rộng hơn (hội thoại, hiệu ứng âm thanh và gợi ý nhạc cùng với lồng tiếng), hãy mở sẵn hướng dẫn prompt âm thanh gốc ở tab bên cạnh, và thử lồng tiếng đầu tiên ngay trên veo3ai.io.

Câu hỏi thường gặp

Veo 3 có thực sự tạo được giọng lồng tiếng nói, hay chỉ có hiệu ứng âm thanh? Có, Veo 3 tạo lời nói thật, không chỉ hiệu ứng. Hãy đặt đúng những từ cần nói trong dấu ngoặc kép trong prompt và mô tả giọng nói. Nó có thể nói như một người thuyết minh ngoài màn hình hoặc như một nhân vật xuất hiện trong hình, khớp khẩu hình.

Làm sao để giọng nói ở ngoài màn hình thay vì một talking head? Đừng đưa người đang nói vào khung hình. Hãy mô tả hình ảnh (sản phẩm, b-roll, phong cảnh) và gọi giọng đó là "người thuyết minh ngoài màn hình". Khi không có miệng nào trước máy quay, Veo 3 hiểu giọng đó là lời thuyết minh phủ lên hình ảnh.

Vì sao Veo 3 cắt mất phần cuối lời thuyết minh của tôi? Câu thoại quá dài so với clip. Cách đọc tự nhiên chạy khoảng 2–3 từ mỗi giây, nên một clip 8 giây chứa khoảng 16–22 từ. Hãy rút gọn câu thoại hoặc chia ra nhiều clip.

Làm sao giữ cùng một giọng thuyết minh qua nhiều clip? Lặp lại mô tả giọng nói từng từ một trong mọi prompt: cùng độ tuổi, giới tính, accent và giọng điệu. Mô hình tái tạo những gì bạn giữ giống hệt nhau, giống như tính nhất quán về nhân vật trong hình ảnh.

Veo 3 có lồng tiếng được bằng ngôn ngữ hoặc accent khác không? Có. Hãy gọi tên accent thật cụ thể ("soft French-accented English", "neutral American") để có cách đọc mang accent, hoặc viết câu thoại trong ngoặc kép bằng một ngôn ngữ khác và nêu ngôn ngữ đó trong phần chỉ dẫn. Luôn nghe lại các kết quả ngoài tiếng Anh để kiểm tra chất lượng.

Nên dùng giọng gốc của Veo 3 hay công cụ TTS riêng? Với nội dung ngắn, quảng cáo và clip mạng xã hội, giọng gốc nhanh hơn và giọng nói tự động khớp với cảnh cùng chuyển động môi. Với kịch bản rất dài hoặc một giọng có cấp phép cụ thể, một lượt TTS chuyên dụng trên cảnh quay đã ghép cho nhiều quyền kiểm soát biên tập hơn.

Ready to create AI videos?
Turn ideas and images into finished videos with the core Veo3 AI tools.

Related Articles

Continue with more blog posts in the same locale.

Browse all posts