🎙️ Google Ra Mắt Gemini 3.5 Transcribe: Chuyển Giọng Nói Thành Văn Bản Cực Chuẩn

🎙️ Google Ra Mắt Gemini 3.5 Transcribe: Chuyển Giọng Nói Thành Văn Bản Cực Chuẩn

Google vừa tung ra công cụ chuyển giọng nói thành văn bản mạnh nhất từ trước đến nay của hãng. Ngày 26 tháng 8 năm 2026, Gemini 3.5 Transcribe chính thức có mặt ở dạng preview công khai trong Gemini API, mở ra một chương mới cho bài toán transcription. Model kế thừa dòng Gemini nhưng được huấn luyện chuyên biệt cho một việc duy nhất: nghe và ghi lại chính xác những gì con người nói ra.

🌍 Hiểu 85+ Ngôn Ngữ Cùng Lúc, Không Ngợp Khi Đổi Giọng

Model này tự động nhận diện hơn 85 ngôn ngữ mà không cần khai báo trước. Điểm hay nằm ở khả năng xử lý code-switching, tức là khi người nói chuyển qua lại giữa hai ngôn ngữ trong cùng một câu, kiểu chêm tiếng Anh vào câu tiếng Việt. Nhiều model transcription cũ bó tay ở tình huống này, còn Gemini 3.5 Transcribe vẫn theo kịp mạch nói tự nhiên.

Model còn gắn timestamp cho từng từ và tách riêng từng người nói qua tính năng speaker diarization. Với cuộc họp nhiều người hoặc podcast nhiều khách mời, đây là tính năng đáng giá để dựng transcript có cấu trúc rõ ràng.

🎯 Sai Số Chỉ 2.6%, Thấp Hơn Hẳn Mặt Bằng Chung

Theo đo lường của Artificial Analysis, tỷ lệ lỗi từ (WER) của Gemini 3.5 Transcribe đạt 4.0% ở chế độ streaming và 2.6% ở chế độ non-streaming. Con số này phản ánh độ chính xác cao khi xử lý audio thực tế, kể cả khi có tiếng ồn nền, thuật ngữ chuyên ngành, hoặc người nói ngập ngừng, lặp từ.

Khác với cách làm truyền thống là nhận diện âm thanh rồi chỉnh sửa văn bản qua nhiều bước, Gemini 3.5 Transcribe xử lý trực tiếp từ audio thô ra văn bản đã định dạng sạch, giảm hẳn công đoạn hậu kỳ.

⚡ Trả Kết Quả Nhanh Hơn 70% So Với Chirp 3

Thời gian trả về bản ghi cuối cùng của Gemini 3.5 Transcribe cải thiện tới 70% so với model tiền nhiệm Chirp 3. Với ứng dụng cần transcript gần như tức thì, chẳng hạn trợ lý giọng nói realtime hoặc phụ đề trực tiếp, tốc độ này tạo ra khác biệt rõ rệt trong trải nghiệm người dùng.

🔧 Hai Biến Thể Cho Hai Kịch Bản Sử Dụng

Google chia model thành hai biến thể riêng. gemini-3.5-transcribe xử lý audio đã ghi âm sẵn qua Interactions API, phù hợp để chuyển đổi file ghi âm cuộc họp hoặc video có sẵn. Còn gemini-3.5-transcribe-live xử lý audio trực tiếp qua Live API, dành cho tình huống cần transcript ngay khi người dùng đang nói.

Cả hai biến thể đều khả dụng trong Google AI Studio và Gemini Enterprise Agent Platform, kèm tùy chọn custom vocabulary biasing để model nhận đúng thuật ngữ chuyên ngành hay tên riêng ít gặp.

📱 Đã Có Mặt Trên Gboard, Gemini App, Sắp Tới Chrome

Google không dừng ở API. Tính năng này đã được tích hợp vào Gboard Rambler để ghi chú giọng nói ngay trên bàn phím, vào ứng dụng Gemini, và sắp tới sẽ xuất hiện trên trình duyệt Chrome. Với nhà phát triển, đây là lựa chọn mới cho ứng dụng cần transcript chính xác đa ngôn ngữ như ghi chú cuộc họp, phụ đề video, hay trợ lý giọng nói, mà không cần tự train riêng cho từng ngôn ngữ hay ngành nghề. Chỉ cần gọi API, đưa audio vào, và nhận lại văn bản sạch, có timestamp, tách người nói rõ ràng.

Bạn nghĩ Gemini 3.5 Transcribe sẽ thay đổi cách bạn ghi chú cuộc họp hay làm phụ đề video như thế nào?

#AI #Google #GeminiAI #VibeAICoder

Bài viết liên quan

🎙️ Google Ra Mắt Gemini 3.5 Transcribe: Chuyển Giọng Nói Thành Văn Bản Cực Chuẩn | Vibe AI Coder