OpenAI vừa âm thầm đổi cuộc chơi trong lĩnh vực phiên âm giọng nói

Mr. Darcy
Mr. Darcy
Phản hồi: 0
  • Thread starter Thread starter Mr. Darcy
  • Ngày gửi Ngày gửi

Mr. Darcy

Editor
Thành viên BQT
Hôm nay, 29 tháng 7, OpenAI công bố trên nền tảng X việc ra mắt hai mô hình phiên âm mới là GPT-Live-Transcribe và GPT-Transcribe, cả hai đều hỗ trợ gọi qua API.

Về chi phí, GPT-Live-Transcribe có giá 0,017 đô la Mỹ mỗi phút, tương đương khoảng 425 đồng mỗi phút. GPT-Transcribe rẻ hơn nhiều, chỉ 0,0045 đô la Mỹ mỗi phút, tương đương khoảng 112 đồng mỗi phút.

OpenAI cho biết so với các mô hình trước đây của hãng, hai mô hình này hiểu ngữ cảnh tốt hơn và cho ra bản phiên âm chính xác hơn, ngay cả với âm thanh đời thực có nhiều giọng điệu, ngôn ngữ khác nhau. Chúng xử lý tốt cả cụm từ, con số, thuật ngữ kỹ thuật lẫn lời nói trong môi trường ồn ào.

Hai mô hình này cũng có vai trò khác nhau. GPT-Live-Transcribe được xây dựng riêng cho phiên âm thời gian thực, ưu tiên độ trễ thấp. Trong khi đó, GPT-Transcribe tối ưu cho việc xử lý các tệp âm thanh đã hoàn thành và khối lượng công việc theo lô, không cần thời gian thực.

Về độ chính xác, trên bộ dữ liệu chuẩn Context Aware ASR, độ chính xác ngữ nghĩa của GPT-Transcribe tăng từ 41,6% khi không có ngữ cảnh lên 45,2% khi có ngữ cảnh.
1785296817267.png
Trên bộ dữ liệu Common Voice gồm 22 ngôn ngữ, GPT-Transcribe đạt tỷ lệ lỗi phiên âm 19,27%, trong khi Whisper (whisper-1) chỉ đạt 40,37%. Còn trên bộ dữ liệu ghi âm thực tế gồm 9 ngôn ngữ, tỷ lệ lỗi của GPT-Transcribe là 8,98%, so với 15,21% của Whisper.

Nói ngắn gọn, OpenAI không chỉ ra mắt công cụ phiên âm mới, mà còn chứng minh bằng số liệu rằng nó chính xác hơn hẳn thế hệ trước, với mức giá gần như không đáng kể.
 
Back
Top