Gemini 3.5 Transcribe

Gemini 3.5 Transcribe to model zamiany mowy na tekst oparty na możliwościach Gemini w zakresie rozumienia dźwięku. Zapewnia dokładną transkrypcję o niskim poziomie opóźnień z wykrywaniem języka na podstawie wypowiedzi, rozdzielaniem rozmówców, sygnaturami czasowymi na poziomie słów, inteligentną transkrypcją i rozpoznawaniem słów z uwzględnieniem kontekstu w przypadku słownictwa niestandardowego.

Dokumentacja

Gemini 3.5 Transcribe przekształca mowę z plików audio na tekst. Automatycznie wykrywa ponad 85 języków, obsługuje przełączanie kodu w wielu językach, identyfikuje poszczególnych rozmówców, podaje sygnatury czasowe na poziomie słów i dostosowuje się do terminów specyficznych dla danej dziedziny dzięki uwzględnianiu słownictwa niestandardowego.

Pełne omówienie funkcji, które nie są związane ze streamingiem, znajdziesz w przewodniku Transkrypcja dźwięku. Aby uzyskać transkrypcję strumieniową w czasie rzeczywistym z małym opóźnieniem przez WebSockets, zapoznaj się z przewodnikiem Transkrypcja na żywo, korzystając z gemini-3.5-transcribe-live. Szczegółowe informacje o cenach znajdziesz na stronie z cennikiem.

gemini-3.5-transcribe

Właściwość Opis
Kod modelu gemini-3.5-transcribe
Obsługiwane typy danych

Dane wejściowe

Dźwięk (do 1 godziny)

Dane wyjściowe

Adnotacje tekstowe i słowne

Limity dotyczące dźwięku

Limit audio w przypadku wywołań binarnych

Do 1 godziny na żądanie (do 30 minut, gdy włączone jest rozdzielanie rozmówców lub sygnatury czasowe na poziomie słów)

Uprawnienia

Transkrypcja audio

Obsługiwane

Rozdzielanie rozmówców

Obsługiwane

Sygnatury czasowe na poziomie słów

Obsługiwane

Słownictwo niestandardowe

Obsługiwane

Inteligentna transkrypcja

Obsługiwane

Zapisywanie w pamięci podręcznej

Nieobsługiwane

Wykonanie kodu

Nieobsługiwane

Wyszukiwanie plików

Nieobsługiwane

Wywoływanie funkcji

Nieobsługiwane

Generowanie obrazów

Nieobsługiwane

Myślenie

Nieobsługiwane

 Opcje wykorzystania

Batch API

Nieobsługiwane

Wnioskowanie Flex

Nieobsługiwane

Priorytet wnioskowania

Nieobsługiwane

Wersje
Więcej informacji znajdziesz w wzorcach wersji modelu.
  • gemini-3.5-transcribe (Unary)
  • gemini-3.5-transcribe-live (Live API)
Ostatnia aktualizacja Sierpień 2026 r.

Obsługa funkcji i ograniczenia

Gemini 3.5 Transcribe obsługuje te funkcje w ramach 2 punktów końcowych:

Funkcja Transmisja na żywo (gemini-3.5-transcribe-live) Przetwarzanie plików audio (gemini-3.5-transcribe) Uwagi i ograniczenia
Automatyczne wykrywanie języka Obsługiwane (ponad 85 języków) Obsługiwane (ponad 85 języków) Obejmuje mieszanie kodu w trakcie sesji.
Sygnatury czasowe na poziomie słowa Nieobsługiwane Obsługiwane obniża dokładność transkrypcji;
Ustalanie priorytetów dla słownictwa niestandardowego Obsługiwane (maksymalnie 1000 terminów) Obsługiwane (maksymalnie 1000 terminów) Klienci zwykle uzyskują najlepsze wyniki w przypadku maksymalnie 100 słów.
Inteligentne dyktowanie i formatowanie Obsługiwane Obsługiwane Obejmuje usuwanie wypełniaczy i formatowanie alfanumeryczne uwzględniające intencje.
Dzielenie na mówców Nieobsługiwane Obsługiwane (maksymalnie 8 głośników) Atrybucja w przypadku co najmniej 3 głośników jest eksperymentalna.
Maksymalny czas trwania dźwięku 10 minut na sesję. Do 1 godziny Przetwarzanie plików jest ograniczone do 30 minut, gdy włączone są funkcje takie jak podział na mówców czy sygnatury czasowe.

Obsługiwane języki

Gemini 3.5 Transcribe obsługuje te języki i kody języków w standardzie BCP-47:

Język Kod BCP-47 Język Kod BCP-47
afrikaans af-ZA japoński ja-JP
amharski am-ET jawajski jv-ID
arabski (Egipt) ar-EG kabuverdianu kea-CV
ormiański hy-AM kannada kn-IN
asamski as-IN kazachski kk-KZ
azerski az-AZ koreański ko-KR
białoruski be-BY kirgiski ky-KG
bengalski (Bangladesz) bn-BD łotewski lv-LV
bengalski (Indie) bn-IN lingala ln-CD
bośniacki bs-BA litewski lt-LT
bułgarski bg-BG macedoński mk-MK
bułgarski (arumuński), rup-BG malajski ms-MY
birmański my-MM malajalam ml-IN
kantoński (tradycyjny), yue-Hant-HK maltański mt-MT
kataloński ca-ES chiński mandaryński (uproszczony), cmn-Hans-CN
cebuański ceb marathi mr-IN
khmerski km-KH mongolski mn-MN
chorwacki hr-HR nepalski ne-NP
czeski cs-CZ norweski nb-NO
duński da-DK orija or-IN
niderlandzki nl-NL polski pl-PL
angielski (Wielka Brytania) en-GB portugalski (Brazylia) pt-BR
angielski (Indie) en-IN portugalski (Portugalia) pt-PT
angielski (USA) en-US pendżabski pa-IN
estoński et-EE pendżabski (pismo gurmukhi), pa-Guru-IN
perski fa-IR rumuński ro-RO
filipiński fil-PH rosyjski ru-RU
fiński fi-FI serbski sr-RS
francuski fr-FR sindhi (alfabet arabski) sd-Arab-IN
galicyjski gl-ES słowacki sk-SK
gruziński ka-GE słoweński sl-SI
niemiecki de-DE hiszpański (Ameryka Łacińska) es-419
grecki el-GR hiszpański (Stany Zjednoczone) es-US
gudżarati gu-IN suahili (Kenia) sw-KE
hausa ha-NG szwedzki sv-SE
hebrajski he-IL tadżycki tg-TJ
hindi hi-IN telugu te-IN
węgierski hu-HU tajski th-TH
islandzki is-IS turecki tr-TR
indyjski angielski en-IN ukraiński uk-UA
indonezyjski id-ID uzbecki uz-UZ
włoski it-IT wietnamski vi-VN