OpenAI vừa công bố kiến trúc WebRTC mới giúp ChatGPT Voice và Realtime API đạt độ trễ cực thấp, giảm thiểu các khoảng dừng khó chịu khi trò chuyện. Với hơn 900 triệu người dùng hàng tuần, bất kỳ độ trễ nào cũng có thể phá vỡ trải nghiệm tự nhiên của cuộc hội thoại.
Bài toán độ trễ trong Voice AI
Khi bạn nói chuyện với AI qua giọng nói, mỗi mili giây đều quan trọng. Nếu mạng chậm, bạn sẽ nghe thấy những khoảng ngắt quãng hoặc lời thoại bị cắt xén. Điều này đặc biệt nghiêm trọng với các ứng dụng như ChatGPT Voice, nơi người dùng có thể ngắt lời AI bất cứ lúc nào. OpenAI nhận ra WebRTC (giao thức truyền thông thời gian thực) tiêu chuẩn không đáp ứng được quy mô của họ.
Giải pháp: Split relay và Transceiver
Nhóm kỹ thuật với sự tham gia của Yi Zhang và William McDonald đã thiết kế lại toàn bộ stack WebRTC, tách quá trình thiết lập kết nối (ICE/DTLS) khỏi quá trình xử lý media. Hệ thống mới có tên gọi split relay plus transceiver giúp định tuyến gói tin thông minh, giảm độ trễ đầu tiên (first-hop latency) và loại bỏ hiện tượng rung pha (jitter), nguyên nhân chính gây ra giọng nói bị đứt quãng.
Tác động đến người dùng thông thường
Với bản cập nhật này, ChatGPT Voice sẽ phản hồi như một cuộc gọi thoại thực sự: bạn có thể ngắt lời, nói nhanh, hoặc chuyển chủ đề mà không thấy độ trễ. Các nhà phát triển xây dựng ứng dụng trên Realtime API cũng được hưởng lợi trực tiếp, đặc biệt trong các tác vụ tương tác như hỗ trợ khách hàng hoặc chatbot giọng nói.
Bài đăng này mở ra hướng đi mới cho ngành công nghệ giọng nói, khẳng định vị thế của OpenAI trong cuộc đua AI thời gian thực. Mặc dù Google (GOOGL) với WebRTC gốc và Meta (META) với các công cụ thực tế ảo cũng đang đầu tư mạnh, nhưng giải pháp của OpenAI cho thấy việc tối ưu hóa hạ tầng mạng có thể tạo ra khác biệt lớn cho người dùng cuối.






