Recapo

Cách cải thiện độ chính xác của phụ đề tự động (ít lỗi hơn)

Cách cải thiện độ chính xác của phụ đề tự động: làm sạch âm thanh đầu vào, ghi âm để người phiên âm có thể theo dõi, cung cấp danh sách từ tùy chỉnh cho tên.

Cách cải thiện độ chính xác của phụ đề tự động (ít lỗi hơn)

Phụ đề tự động đặt sai tên, chấm câu ngẫu nhiên và nghe sai toàn bộ cụm từ — và chiến thắng lớn nhất về cách cải thiện độ chính xác của phụ đề tự động ít đến từ việc chuyển đổi công cụ hơn là sửa những gì bạn cung cấp cho công cụ. Chuyển giọng nói thành văn bản chỉ tốt khi âm thanh mà nó nghe thấy và các từ mà nó mong đợi, vì vậy hướng dẫn này luôn chặt chẽ các đòn bẩy mà người sáng tạo thực sự kiểm soát: âm thanh đầu vào sạch hơn, thói quen ghi âm mà người phiên âm có thể làm theo, danh sách từ tùy chỉnh cho tên và biệt ngữ và vòng lặp phiên âm-chỉnh sửa-xuất nhanh chóng để bắt bất cứ thứ gì lọt qua. Bốn chú thích và không chính xác đó có trở thành một hiệu đính nhanh chóng, không phải là một vấn đề đau đầu lặp đi lặp lại.

Tại sao phụ đề tự động không chính xác — và cách cải thiện độ chính xác của phụ đề tự động

Trước khi bạn có thể sửa phụ đề tự động, bạn nên biết lý do tại sao chúng bỏ lỡ. Mọi tính năng phụ đề tự động đều chạy trên nhận dạng giọng nói: mô hình lắng nghe âm thanh của bạn, đoán các từ có khả năng xảy ra nhất và đóng dấu thời gian trên chúng. Nó thất bại theo những cách có thể dự đoán được - và hầu hết những thất bại đó bắt nguồn từ đầu vào, không phải thuật toán.

Nguyên nhân của lỗi Trong tầm kiểm soát của bạn? Cách khắc phục

Nhạc nền hoặc tiếng ồn khi nóiLàm sạch âm thanh trước khi phiên âm
Hai người nói chuyện với nhauCô lập một loa cho mỗi phân đoạn
Tiếng vang / hồi âm trong phòngChủ yếuThu âm gần hơn, xử lý căn phòng
Tên, thương hiệu, biệt ngữ, từ viết tắtCung cấp danh sách từ tùy chỉnh, hiệu đính
Giao hàng nhanh, lẩm bẩm hoặc cắt xénChậm lại, phát âm, đóng mic
Trọng âm mạnh hoặc giọng nói không phải là bản ngữMột phầnChọn một trình phiên âm xử lý nó
Âm thanh tốc độ bit thấp hoặc loa điện thoạiGhi vào tệp nguồn sạch

Đọc cột câu trả lời "có" đó và chiến lược sẽ tự viết. Không phải lúc nào bạn cũng có thể thay đổi trọng âm trong bản ghi âm của người khác, nhưng bạn hầu như luôn có thể đưa cho trình phiên âm âm thanh sạch hơn và danh sách các từ mà nó có thể dò dẫm. Đó là đòn bẩy - và tại sao theo đuổi một công cụ "thông minh hơn" trước khi sửa chữa đầu vào thường gây thất vọng.

Sửa đầu vào trước: làm sạch âm thanh cho phụ đề

Làm sạch âm thanh nguồn là một biến hữu ích để kiểm tra vì người phiên âm chỉ có thể chú thích tín hiệu mà nó nhận được một cách rõ ràng. Hai vấn đề chiếm ưu thế.

Tiếng ồn xung quanh ổn định - tiếng vo ve HVAC, giao thông, quạt máy tính xách tay, tiếng rít của băng - nằm dưới giọng nói của bạn và làm mờ các cạnh của từ, vì vậy người mẫu đoán. Chạy bản nhạc qua giảm tiếng ồn trước khi bạn phiên âm sẽ kéo sàn đó xuống và truyền cho mô hình tín hiệu rõ ràng hơn. Thực hiện điều này trên âm thanh nguồn, không phải sau khi phụ đề - mục tiêu là để cải thiện những gì người phiên âm nghe thấy, không phải để vá đầu ra.

** Một chiếc giường âm nhạc dưới giọng nói ** là cái lén lút hơn. Âm nhạc chia sẻ không gian tần số với giọng nói, vì vậy một người phiên âm cố gắng tạo chú thích cho một người nói chuyện trên một bản nhạc đệm sẽ rơi xuống và nghe nhầm những từ mà nó sẽ đóng đinh trên giọng hát khô. Nếu bản ghi âm của bạn có giọng nói và âm nhạc được trộn vào một bản nhạc, hãy tách giọng nói bằng stem-splitter, phiên âm từ giọng hát sạch, sau đó đưa nhạc trở lại cho bản phối cuối cùng. Bạn chú thích giọng nói, không phải bài hát chiến đấu với nó.

Thứ tự quan trọng: sạch sẽ trước, phiên âm thứ hai - một giọng hát không nhiễu, không có âm nhạc làm được nhiều hơn về độ chính xác hơn bất kỳ chỉnh sửa sau thực tế nào. Nếu bạn mới dọn dẹp âm thanh, hướng dẫn của chúng tôi về cách dọn dẹp âm thanh cho video bao gồm toàn bộ thứ tự hoạt động.

Ghi lại để người phiên âm có thể theo dõi

Một nửa độ chính xác được quyết định trước khi bạn nhấn "tạo", tại thời điểm ghi. Người phiên âm không phải là người đọc suy nghĩ - nó tuân theo tín hiệu rõ ràng nhất mà nó được đưa ra và những thói quen này không tốn kém gì.

  1. Micrô đóng, micrô nhất quán. Nguồn gần loa và ở mức ổn định cung cấp cho mô hình các phụ âm sắc nét - nơi ẩn hầu hết các lỗi từ - thay vì rửa từ xa, màu phòng.
  2. ** Mỗi lần một loa.** Nhiễu xuyên âm là nơi phụ đề tự động bị hỏng nhanh nhất. Khi hai giọng nói chồng lên nhau, mô hình không thể phân bổ một cách rõ ràng, vì vậy nó làm rối loạn cả hai. Trong các cuộc phỏng vấn, huấn luyện khách mời để một nhịp hạ cánh trước khi trả lời.
  3. ** Thuần hóa căn phòng.** Reverb bôi nhọ các kết thúc từ. Ghi âm trong không gian được trang bị nội thất mềm hoặc gần micrô hơn trong không gian sáng, sẽ cắt giảm tiếng vang mà người mẫu phải chiến đấu.
  4. ** Phát âm theo tốc độ của con người.** Bạn không cần cách diễn đạt trên radio - chỉ cần tránh cách truyền tải lẩm bẩm, cắt hoặc vội vàng mà ngay cả một người cũng yêu cầu bạn lặp lại. Nếu một từ quan trọng (tên, số), hãy hạ cánh nó một cách sạch sẽ.

Xây dựng danh sách từ tùy chỉnh cho tên và biệt ngữ

Đây là cách khắc phục mà hầu hết người sáng tạo bỏ qua và đó là cách tiêu diệt các lỗi khiến bạn xấu hổ nhất. Nhận dạng giọng nói thiên về các từ phổ biến. Cung cấp cho nó "Recapo", họ của khách hàng, SKU sản phẩm hoặc từ viết tắt thích hợp và thay vào đó nó sẽ tiếp cận từ hàng ngày gần nhất - đó là lý do tại sao danh từ riêng và biệt ngữ là nơi cụm chú thích không chính xác.

Bản sửa lỗi có hai dạng:

  1. Một từ điển tùy chỉnh, nếu công cụ của bạn hỗ trợ. Một số trình phiên âm cho phép bạn đăng ký các thuật ngữ - tên, thương hiệu, từ vựng kỹ thuật - trước khi bạn chạy công việc, vì vậy mô hình mong đợi chúng. Khi tùy chọn đó tồn tại, đó là cách sạch nhất để đặt đúng tên ngay lần đầu tiên. Tải các từ mà kênh của bạn nói liên tục: thương hiệu của riêng bạn, khách định kỳ, biệt ngữ của thị trường ngách của bạn.
  2. ** Danh sách sửa lỗi có thể tái sử dụng, nếu không.** Không có trường từ điển tùy chỉnh? Giữ một tệp văn bản ngắn về các thuật ngữ mà người phiên âm của bạn luôn làm xáo trộn và cách chúng nên đọc. Sửa chúng một lần cho mỗi video trong quá trình hiệu đính và vì bạn đang dán từ một danh sách đã biết, nên việc vượt qua sẽ mất vài giây thay vì một cuộc săn lùng.

Dù bằng cách nào, nguyên tắc vẫn đúng: người phiên âm có thể tự đóng đinh lời nói thông thường; Công việc của bạn là đưa cho nó một số từ không phổ biến mà nó không thể đoán được. Thói quen duy nhất đó biến hầu hết những lời phàn nàn "tại sao nó cứ viết sai chính tả tên tôi" thành một vấn đề đã được giải quyết.

Chọn một trình phiên âm phù hợp với âm thanh của bạn

Không phải mọi công cụ chuyển giọng nói thành văn bản đều xử lý mọi loại âm thanh như nhau - trọng âm, giọng nói chồng chéo, từ vựng kỹ thuật và ngôn ngữ không phải tiếng Anh đều tách biệt các công cụ. Nhưng đừng tin tưởng vào tỷ lệ phần trăm "độ chính xác" tiếp thị; Nó được đo trên âm thanh phòng thu sạch sẽ trông không giống của bạn. Thay vào đó, hãy chạy thử nghiệm của riêng bạn.

Lấy ** 60 giây tồi tệ nhất ** của bạn - vị khách có dấu, vị trí ồn ào, phân đoạn nặng biệt ngữ - và chạy nó qua bất kỳ trình phiên âm nào bạn đang cân. Sau đó, chấm điểm đầu ra về những gì thực sự quan trọng:

  1. Danh từ riêng. Nó có đúng tên, thương hiệu và địa điểm hay phát minh ra từ đồng âm?
  2. Dấu câu và viết hoa. Các câu bị phá vỡ một cách hợp lý, hay đó là một khối chạy?
  3. Khả năng chỉnh sửa. Bạn có thể sửa bản ghi tại chỗ, lý tưởng nhất là bên cạnh video, thay vì xuất và nhập lại không?
  4. Thời gian cấp từ. Nó có đóng dấu thời gian cho mỗi từ, không chỉ trên mỗi dòng - dữ liệu bạn cần cho phụ đề chặt chẽ, được đồng bộ hóa tốt?
  5. Ngôn ngữ bạn thực sự sử dụng. Nếu bạn phụ đề bằng nhiều ngôn ngữ, nó có phù hợp với mỗi ngôn ngữ không?

Một công cụ truyền âm thanh thực của bạn sẽ phục vụ bạn; một cái chỉ tỏa sáng trên một clip demo sẽ không. Một ai-subtitle-generator có mục đích chung tạo ra một bản ghi có thể chỉnh sửa, theo thời gian từ cung cấp cho bạn nhiều không gian nhất để sửa những gì còn lại. Để có một cuộc khảo sát rộng hơn về các tùy chọn, hãy xem tổng hợp của chúng tôi về trình tạo phụ đề tự động tốt nhất.

Vòng lặp hiệu đính: nơi các lỗi cuối cùng chết

Ngay cả với âm thanh rõ ràng và danh sách từ tốt, không có phụ đề tự động nào sẵn sàng xuất bản mà không bị ảnh hưởng — và phụ đề dạng ngắn sẽ được ghi vào video, vì vậy lỗi chính tả sẽ trở thành vĩnh viễn. Một vòng lặp hiệu đính chặt chẽ là những gì đứng giữa "hầu hết đúng" và "thực sự đúng".

  1. Tạo bản ghi. Chạy âm thanh đã làm sạch của bạn thông qua phụ đề tự động để nhận phụ đề theo thời gian với dòng thời gian cho mỗi từ — bản nháp có thể chỉnh sửa mà bạn sẽ sửa, không phải từ cuối cùng.
  2. ** Quét các mã thông báo có rủi ro cao trước. ** Bạn không đọc lại từng từ; Bạn săn lùng bốn điều mà người phiên âm bỏ lỡ nhất: tên, từ đồng âm ("của họ / ở đó", "đến / hai"), ** số ** (giá cả, ngày tháng, số liệu thống kê) và biệt ngữ. Sửa những lỗi đó và bạn đã phát hiện ra những lỗi thực sự làm mất uy tín của bạn.
  3. Chỉnh sửa bên cạnh video. Chỉnh sửa trong chế độ xem bản chép lời phát clip bên cạnh văn bản, vì vậy bạn sửa lỗi nghe nhầm trong ngữ cảnh và xác nhận thời gian không bị trôi. Điều này nhanh hơn nhiều so với chỉnh sửa tệp phụ đề thô.
  4. Đọc một lần, tắt tiếng. Phát video ở chế độ tắt tiếng và chỉ đọc phụ đề, theo cách mà người xem không có âm thanh sẽ làm — một số người xem gặp phải video dạng ngắn khi tắt âm thanh, theo hướng dẫn trợ năng riêng của nền tảng. Bất cứ điều gì đọc sai đều được sửa ngay bây giờ.
  5. Ghi và xuất. Chỉ sau khi bản chép lời sạch, bạn mới hiển thị phụ đề vào khung. Bởi vì burn-in là vĩnh viễn, hiệu đính không bao giờ là bước bạn bỏ qua.

Vòng lặp đó được thiết kế ngắn: đầu vào và danh sách từ của bạn càng sạch sẽ thì càng ít phải sửa ở đây.

Sơ lược về mẹo về độ chính xác của phụ đề

Giữ danh sách kiểm tra này bên cạnh quy trình làm việc của bạn - đó là con đường ngắn nhất để có phụ đề tự động tốt hơn. Hầu hết các vấn đề về độ chính xác sẽ chết nếu bạn chạy xuống nó trước khi nhấn tạo.

  1. Làm sạch âm thanh trước: khử tiếng ồn và tách bất kỳ giường nhạc nào để bạn phiên âm giọng hát khô.
  2. ** Ghi lại mức gần, ngang bằng và một giọng nói tại một thời điểm **: nhiễu xuyên âm và hồi âm tối thiểu.
  3. Cung cấp danh sách từ tùy chỉnh: thương hiệu, tên, biệt ngữ, từ viết tắt - và kiểm tra công cụ trên clip tồi tệ nhất của bạn, không phải bản demo sạch.
  4. Đọc lại các mã thông báo có rủi ro cao: tên, từ đồng âm, số, biệt ngữ — và đọc tắt tiếng trước khi bạn ghi vào, vì lỗi ghi vào là vĩnh viễn.

Vị trí phù hợp với Recapo

Recapo là một không gian làm việc video AI dựa trên trình duyệt - không cần cài đặt - và toàn bộ vòng lặp độ chính xác trong hướng dẫn này chạy bên trong nó từ đầu đến cuối. Bạn có thể giảm tiếng ồn xung quanh, tách giường nhạc ra khỏi giọng hát, phiên âm và chú thích thành bản chép lời ở cấp từ, có thể chỉnh sửa, hiệu đính tên và số bên cạnh video, sau đó thay đổi kích thước thành 9:16 và xuất với phụ đề được ghi vào — tất cả trong một tab mà không cần chuyển tệp giữa người khử trùng, người phiên âm và người chỉnh sửa. Nó chấp nhận MP4, MOV và các định dạng phổ biến khác, tổng cộng lên đến 6GB cho mỗi tác vụ.

Sự phù hợp thực tế: Recapo làm sạch đầu vào và cung cấp cho bạn một bản ghi có thể chỉnh sửa, nhưng nó không thể phát minh ra một cái tên mà nó chưa bao giờ nghe thấy hoặc quyết định bạn muốn nói đến từ đồng âm nào. Những cuộc gọi phán xét đó - danh sách từ tùy chỉnh, đọc qua bị tắt tiếng, hiệu đính cuối cùng - vẫn là của bạn và chúng là thứ biến một phụ đề tự động tốt thành một phụ đề sạch sẽ. Nếu phụ đề là một phần định kỳ trong thói quen của bạn, thì việc có âm thanh sạch, phiên âm và hiệu đính trong một tab duy nhất là công việc mà nó được xây dựng cho. Các gói hoạt động trên trang định giá.

Câu hỏi thường gặp

Tại sao phụ đề tự động của tôi không chính xác như vậy?

Hầu như luôn luôn là do âm thanh, không phải công cụ. Tiếng ồn xung quanh, giường âm nhạc dưới giọng nói, loa chồng lên nhau và tiếng lẩm bẩm hoặc truyền tải từ xa, tất cả đều buộc mô hình giọng nói phải đoán và nó đoán sai những từ khó. Tên, thương hiệu và biệt ngữ thêm một lớp thứ hai, bởi vì sự nhận dạng thiên về các từ thông thường. Làm sạch âm thanh, ghi âm gần hơn với từng giọng nói và cung cấp cho người phiên âm các thuật ngữ không phổ biến của bạn - điều này sẽ khắc phục hầu hết các phụ đề không chính xác trước khi bạn hiệu đính.

Dọn dẹp âm thanh có thực sự cải thiện độ chính xác của phụ đề không?

Vâng, và đó thường là chiến thắng đơn lẻ lớn nhất. Người phiên âm chỉ có thể chú thích những gì nó có thể nghe rõ ràng, vì vậy tiếng ồn ổn định và một bản nhạc cạnh tranh trực tiếp gây ra các từ bị rơi và nhầm lẫn. Khử nhiễu nguồn và cách ly giọng nói khỏi bất kỳ giường nhạc nào trước khi bạn phiên âm sẽ trao cho mô hình một tín hiệu rõ ràng hơn và cắt lỗi ở gốc - hiệu quả hơn nhiều so với việc sửa đầu ra sau đó.

Làm cách nào để sửa tên và biệt ngữ trong phụ đề tự động?

Hai cách. Nếu trình phiên âm của bạn hỗ trợ từ điển tùy chỉnh, hãy đăng ký tên, thương hiệu và thuật ngữ kỹ thuật trước khi bạn chạy công việc sao cho mô hình mong đợi chúng. Nếu không, hãy giữ một danh sách ngắn có thể tái sử dụng các từ mà nó luôn làm xáo trộn và dán các chỉnh sửa trong quá trình hiệu đính. Một trong hai cách tiếp cận đều biến những lỗi khiến bạn xấu hổ nhất - thương hiệu của riêng bạn hoặc tên của khách bị đánh vần sai - thành một bản sửa lỗi có thể lặp lại.

Tôi có thể cải thiện độ chính xác mà không cần ghi lại không?

Thông thường, có. Bạn có thể khử nhiễu bản nhạc hiện có, tách một giường nhạc ra khỏi giọng hát và chạy âm thanh đã làm sạch thông qua trình phiên âm xử lý loại bài phát biểu của bạn, sau đó đọc lại kết quả — tất cả mà không cần ghi lại bất cứ điều gì. Ghi lại chỉ được đền đáp khi chính nguồn là vấn đề (nhiễu xuyên âm nặng, hồi âm nghiêm trọng hoặc chụp loa điện thoại); Đối với hầu hết các cảnh quay, làm sạch đầu vào và hiệu đính sẽ thu hẹp khoảng cách.

Tôi nên mong đợi độ chính xác nào từ phụ đề tự động?

Nó thay đổi quá nhiều để hứa hẹn một con số - âm thanh một loa trong trẻo, có micrô gần phiên âm tốt hơn nhiều so với bản ghi âm nhiều loa ồn ào và kết quả khác nhau tùy theo ngôn ngữ và giọng nói. Thay vì tin tưởng vào tỷ lệ phần trăm tiêu đề của nhà cung cấp, hãy kiểm tra bất kỳ công cụ nào trong 60 giây tồi tệ nhất của riêng bạn. Dù là công cụ nào, hãy lên kế hoạch hiệu đính ngắn về tên, từ đồng âm và số trước khi bạn ghi chú thích - thẻ cuối cùng đó là thứ khiến chúng sẵn sàng xuất bản.

Bạn đã sẵn sàng để ngừng chiến đấu với phụ đề không chính xác? Tạo tài khoản miễn phí, tải lên cảnh quay của bạn - MP4 hoặc MOV, tổng cộng lên đến 6GB cho mỗi tác vụ - và chạy toàn bộ vòng lặp độ chính xác trong một tab trình duyệt: khử nhiễu, tách bất kỳ giường nhạc nào, phiên âm thành bản ghi có thể chỉnh sửa ở cấp độ từ mà bạn đã hiệu đính bên cạnh video, sau đó điều chỉnh lại thành 9:16 và xuất với phụ đề được ghi vào. Bạn mang đến âm thanh rõ ràng và bản đọc cuối cùng; Recapo xử lý quá trình sản xuất, vì vậy video tải lên tiếp theo của bạn sẽ đi kèm với chú thích nói lên những gì bạn thực sự nói.

Tài liệu tham khảo và nguồn chính thức

  1. Trợ giúp YouTube: Thêm phụ đề và chú thích
  2. Tài liệu web MDN: WebVTT API
  3. Recapo.ai: Tổng quan về sản phẩm và giới hạn tải lên hiện tại
  4. Recapo.ai: Trình chỉnh sửa video AI
  5. FFmpeg: Tài liệu chính thức


Bài viết đề xuất

Xem tất cả