Indice
Speech(interfaccia)AccessMetadata(messaggio)AccessMetadata.ConstraintType(enum)AutoDetectDecodingConfig(messaggio)BatchRecognizeFileMetadata(messaggio)BatchRecognizeFileResult(messaggio)BatchRecognizeMetadata(messaggio)BatchRecognizeRequest(messaggio)BatchRecognizeRequest.ProcessingStrategy(enum)BatchRecognizeResponse(messaggio)BatchRecognizeResults(messaggio)BatchRecognizeTranscriptionMetadata(messaggio)CloudStorageResult(messaggio)Config(messaggio)CreateCustomClassRequest(messaggio)CreatePhraseSetRequest(messaggio)CreateRecognizerRequest(messaggio)CustomClass(messaggio)CustomClass.ClassItem(messaggio)CustomClass.State(enum)DeleteCustomClassRequest(messaggio)DeletePhraseSetRequest(messaggio)DeleteRecognizerRequest(messaggio)DenoiserConfig(messaggio)ExplicitDecodingConfig(messaggio)ExplicitDecodingConfig.AudioEncoding(enum)GcsOutputConfig(messaggio)GetConfigRequest(messaggio)GetCustomClassRequest(messaggio)GetPhraseSetRequest(messaggio)GetRecognizerRequest(messaggio)InlineOutputConfig(messaggio)InlineResult(messaggio)LanguageMetadata(messaggio)ListCustomClassesRequest(messaggio)ListCustomClassesResponse(messaggio)ListPhraseSetsRequest(messaggio)ListPhraseSetsResponse(messaggio)ListRecognizersRequest(messaggio)ListRecognizersResponse(messaggio)LocationsMetadata(messaggio)ModelFeature(messaggio)ModelFeatures(messaggio)ModelMetadata(messaggio)NativeOutputFileFormatConfig(messaggio)OperationMetadata(messaggio)OutputFormatConfig(messaggio)PhraseSet(messaggio)PhraseSet.Phrase(messaggio)PhraseSet.State(enum)RecognitionConfig(messaggio)RecognitionFeatures(messaggio)RecognitionFeatures.MultiChannelMode(enum)RecognitionOutputConfig(messaggio)RecognitionResponseMetadata(messaggio)RecognizeRequest(messaggio)RecognizeResponse(messaggio)Recognizer(messaggio)Recognizer.State(enum)SpeakerDiarizationConfig(messaggio)SpeechAdaptation(messaggio)SpeechAdaptation.AdaptationPhraseSet(messaggio)SpeechRecognitionAlternative(messaggio)SpeechRecognitionResult(messaggio)SrtOutputFileFormatConfig(messaggio)StreamingRecognitionConfig(messaggio)StreamingRecognitionFeatures(messaggio)StreamingRecognitionFeatures.VoiceActivityTimeout(messaggio)StreamingRecognitionResult(messaggio)StreamingRecognizeRequest(messaggio)StreamingRecognizeResponse(messaggio)StreamingRecognizeResponse.SpeechEventType(enum)TranscriptNormalization(messaggio)TranscriptNormalization.Entry(messaggio)TranslationConfig(messaggio)UndeleteCustomClassRequest(messaggio)UndeletePhraseSetRequest(messaggio)UndeleteRecognizerRequest(messaggio)UpdateConfigRequest(messaggio)UpdateCustomClassRequest(messaggio)UpdatePhraseSetRequest(messaggio)UpdateRecognizerRequest(messaggio)VttOutputFileFormatConfig(messaggio)WordInfo(messaggio)
Voce
Consente la trascrizione vocale e la gestione delle risorse.
| BatchRecognize |
|---|
|
Esegue il riconoscimento vocale asincrono batch: invia una richiesta con N file audio e ricevi un'operazione a lunga esecuzione che può essere sottoposta a polling per verificare quando le trascrizioni sono terminate.
|
| CreateCustomClass |
|---|
|
Crea un
|
| CreatePhraseSet |
|---|
|
Crea un
|
| CreateRecognizer |
|---|
|
Crea un
|
| DeleteCustomClass |
|---|
|
Elimina
|
| DeletePhraseSet |
|---|
|
Elimina
|
| DeleteRecognizer |
|---|
|
Elimina
|
| GetConfig |
|---|
|
Restituisce il
|
| GetCustomClass |
|---|
|
Restituisce il
|
| GetPhraseSet |
|---|
|
Restituisce il
|
| GetRecognizer |
|---|
|
Restituisce il
|
| ListCustomClasses |
|---|
|
Elenca CustomClasses.
|
| ListPhraseSets |
|---|
|
Elenca i PhraseSet.
|
| ListRecognizers |
|---|
|
Elenca i riconoscimenti.
|
| Riconoscimento |
|---|
|
Esegue il riconoscimento vocale sincrono: ricevi i risultati dopo che tutto l'audio è stato inviato ed elaborato.
|
| StreamingRecognize |
|---|
|
Esegue il riconoscimento vocale di audio in streaming bidirezionale: ricevi i risultati mentre invii l'audio. Questo metodo è disponibile solo tramite l'API gRPC (non REST).
|
| UndeleteCustomClass |
|---|
|
Annulla l'eliminazione di
|
| UndeletePhraseSet |
|---|
|
Annulla l'eliminazione di
|
| UndeleteRecognizer |
|---|
|
Annulla l'eliminazione di
|
| UpdateConfig |
|---|
|
Aggiorna
|
| UpdateCustomClass |
|---|
|
Aggiorna
|
| UpdatePhraseSet |
|---|
|
Aggiorna
|
| UpdateRecognizer |
|---|
|
Aggiorna
|
AccessMetadata
I metadati di accesso per una determinata regione. Può essere applicato se la policy dell'organizzazione per il progetto specificato non consente una determinata regione.
| Campi | |
|---|---|
constraint_type |
Descrive i diversi tipi di vincoli applicati. |
ConstraintType
Descrive i diversi tipi di vincoli che possono essere applicati a una regione.
| Enum | |
|---|---|
CONSTRAINT_TYPE_UNSPECIFIED |
Vincolo non specificato applicato. |
RESOURCE_LOCATIONS_ORG_POLICY_CREATE_CONSTRAINT |
Il criterio dell'organizzazione del progetto non consente la regione specificata. |
AutoDetectDecodingConfig
Questo tipo non contiene campi.
Parametri di decodifica rilevati automaticamente. Supportato per le seguenti codifiche:
WAV_LINEAR16: campioni PCM little-endian con segno a 16 bit in un contenitore WAV.
WAV_MULAW: campioni mulaw compressi a 8 bit in un container WAV.
WAV_ALAW: campioni alaw compressi a 8 bit in un container WAV.
RFC4867_5_AMR: frame AMR con un'intestazione rfc4867.5.
RFC4867_5_AMRWB: frame AMR-WB con un'intestazione rfc4867.5.
FLAC: frame FLAC nel formato contenitore "FLAC nativo".
MP3: frame audio MPEG con metadati ID3 facoltativi (ignorati).
OGG_OPUS: frame audio Opus in un container Ogg.
WEBM_OPUS: frame audio Opus in un container WebM.
MP4_AAC: frame audio AAC in un container MP4.
M4A_AAC: frame audio AAC in un container M4A.
MOV_AAC: frame audio AAC in un container MOV.
BatchRecognizeFileMetadata
Metadati di un singolo file in un batch per BatchRecognize.
| Campi | |
|---|---|
config |
Funzionalità e metadati audio da utilizzare per il riconoscimento vocale automatico. Questo campo, in combinazione con il campo |
config_mask |
L'elenco dei campi in |
Campo unione audio_source. L'origine audio, ovvero un URI Google Cloud Storage. audio_source può essere solo uno dei seguenti: |
|
uri |
URI Cloud Storage per il file audio. |
BatchRecognizeFileResult
Risultati finali per un singolo file.
| Campi | |
|---|---|
error |
Errore, se si è verificato. |
metadata |
|
uri |
Deprecato. Utilizza invece |
transcript |
Deprecato. Utilizza invece |
Campo unione
|
|
cloud_storage_result |
Risultati del riconoscimento scritti in Cloud Storage. Questo campo viene compilato solo quando |
inline_result |
Risultati del riconoscimento. Questo campo viene compilato solo quando |
BatchRecognizeMetadata
Metadati dell'operazione per BatchRecognize.
| Campi | |
|---|---|
transcription_metadata |
Mappa dal nome file fornito ai metadati della trascrizione per quel file. |
BatchRecognizeRequest
Messaggio di richiesta per il metodo BatchRecognize.
| Campi | |
|---|---|
recognizer |
Obbligatorio. Il nome del riconoscitore da utilizzare durante il riconoscimento. Il formato previsto è |
config |
Funzionalità e metadati audio da utilizzare per il riconoscimento vocale automatico. Questo campo, in combinazione con il campo |
config_mask |
L'elenco dei campi in |
files[] |
File audio con metadati per il riconoscimento vocale automatico. Il numero massimo di file che possono essere specificati è 15. |
recognition_output_config |
Opzioni di configurazione per la posizione in cui generare le trascrizioni di ogni file. |
processing_strategy |
Strategia di elaborazione da utilizzare per questa richiesta. |
ProcessingStrategy
Possibili strategie di elaborazione per le richieste batch.
| Enum | |
|---|---|
PROCESSING_STRATEGY_UNSPECIFIED |
Valore predefinito per la strategia di elaborazione. La richiesta viene elaborata non appena viene ricevuta. |
DYNAMIC_BATCHING |
Se selezionata, elabora la richiesta durante i periodi di utilizzo inferiore per uno sconto sul prezzo. La richiesta viene soddisfatta entro 24 ore. |
BatchRecognizeResponse
Messaggio di risposta per BatchRecognize incluso in un'operazione di lunga durata Operation.
| Campi | |
|---|---|
results |
Mappa dal nome file al risultato finale per quel file. |
total_billed_duration |
Se disponibili, i secondi di audio fatturati per la richiesta corrispondente. |
BatchRecognizeResults
Tipo di output per Cloud Storage delle trascrizioni BatchRecognize. Sebbene questo proto non venga restituito in questa API, le trascrizioni di Cloud Storage saranno questo proto serializzato e devono essere analizzate di conseguenza.
| Campi | |
|---|---|
results[] |
Elenco sequenziale dei risultati della trascrizione corrispondenti alle porzioni sequenziali dell'audio. |
metadata |
Metadati relativi al riconoscimento. |
BatchRecognizeTranscriptionMetadata
Metadati sulla trascrizione per un singolo file (ad esempio, percentuale di avanzamento).
| Campi | |
|---|---|
progress_percent |
La percentuale di trascrizione del file finora. |
error |
Errore, se si è verificato. |
uri |
L'URI Cloud Storage in cui verranno scritti i risultati del riconoscimento. |
CloudStorageResult
I risultati finali vengono scritti in Cloud Storage.
| Campi | |
|---|---|
uri |
L'URI Cloud Storage in cui sono stati scritti i risultati del riconoscimento. |
vtt_format_uri |
L'URI Cloud Storage in cui i risultati del riconoscimento sono stati scritti come sottotitoli codificati in formato VTT. Questo campo viene compilato solo quando viene richiesto l'output |
srt_format_uri |
L'URI Cloud Storage in cui sono stati scritti i risultati del riconoscimento come sottotitoli codificati in formato SRT. Questo campo viene compilato solo quando viene richiesto l'output |
Configurazione
Messaggio che rappresenta la configurazione dell'API Speech-to-Text. Ciò include una chiave KMS facoltativa con cui verranno criptati i dati in entrata.
| Campi | |
|---|---|
name |
Solo output. Identificatore. Il nome della risorsa di configurazione. Esiste esattamente una risorsa di configurazione per progetto per località. Il formato previsto è |
kms_key_name |
Facoltativo. Un nome della chiave KMS facoltativo che, se presente, verrà utilizzato per criptare le risorse Speech-to-Text at-rest. L'aggiornamento di questa chiave non cripta le risorse esistenti che la utilizzano. Solo le nuove risorse verranno criptate utilizzando questa chiave. Il formato previsto è |
update_time |
Solo output. L'ultima volta che questa risorsa è stata modificata. |
CreateCustomClassRequest
Messaggio di richiesta per il metodo CreateCustomClass.
| Campi | |
|---|---|
custom_class |
Obbligatorio. La CustomClass da creare. |
validate_only |
Se impostato, convalida la richiesta e visualizza l'anteprima di CustomClass, ma non crearla effettivamente. |
custom_class_id |
L'ID da utilizzare per CustomClass, che diventerà il componente finale del nome risorsa di CustomClass. Questo valore deve contenere da 4 a 63 caratteri e i caratteri validi sono /[a-z][0-9]-/. |
parent |
Obbligatorio. Il progetto e la località in cui verrà creata questa CustomClass. Il formato previsto è |
CreatePhraseSetRequest
Messaggio di richiesta per il metodo CreatePhraseSet.
| Campi | |
|---|---|
phrase_set |
Obbligatorio. Il PhraseSet da creare. |
validate_only |
Se impostato, convalida la richiesta e visualizza l'anteprima di PhraseSet, ma non crearlo effettivamente. |
phrase_set_id |
L'ID da utilizzare per PhraseSet, che diventerà il componente finale del nome della risorsa PhraseSet. Questo valore deve contenere da 4 a 63 caratteri e i caratteri validi sono /[a-z][0-9]-/. |
parent |
Obbligatorio. Il progetto e la località in cui verrà creato questo PhraseSet. Il formato previsto è |
CreateRecognizerRequest
Messaggio di richiesta per il metodo CreateRecognizer.
| Campi | |
|---|---|
recognizer |
Obbligatorio. Il riconoscimento da creare. |
validate_only |
Se impostato, convalida la richiesta e visualizza l'anteprima del riconoscitore, ma non crearlo effettivamente. |
recognizer_id |
L'ID da utilizzare per il riconoscitore, che diventerà il componente finale del nome della risorsa del riconoscitore. Questo valore deve contenere da 4 a 63 caratteri e i caratteri validi sono /[a-z][0-9]-/. |
parent |
Obbligatorio. Il progetto e la località in cui verrà creato questo riconoscitore. Il formato previsto è |
CustomClass
CustomClass per la distorsione nel riconoscimento vocale. Utilizzato per definire un insieme di parole o frasi che rappresentano un concetto o un tema comune che probabilmente apparirà nel tuo audio, ad esempio un elenco di nomi di navi passeggeri.
| Campi | |
|---|---|
name |
Solo output. Identificatore. Il nome risorsa di CustomClass. Formato: |
uid |
Solo output. Identificatore univoco assegnato dal sistema per CustomClass. |
display_name |
Facoltativo. Nome leggibile e impostabile dall'utente per CustomClass. Deve contenere al massimo 63 caratteri. |
items[] |
Una raccolta di elementi del corso. |
state |
Solo output. Lo stato del ciclo di vita di CustomClass. |
create_time |
Solo output. Data/ora creazione. |
update_time |
Solo output. L'ultima volta che questa risorsa è stata modificata. |
delete_time |
Solo output. L'ora in cui è stata richiesta l'eliminazione di questa risorsa. |
expire_time |
Solo output. L'ora in cui verrà eliminata questa risorsa. |
annotations |
Facoltativo. Consente agli utenti di memorizzare piccole quantità di dati arbitrari. Sia la chiave che il valore devono contenere al massimo 63 caratteri ciascuno. Al massimo 100 annotazioni. |
etag |
Solo output. Questo checksum viene calcolato dal server in base al valore di altri campi. Questo valore può essere inviato nelle richieste di aggiornamento, ripristino ed eliminazione per garantire che il client disponga di un valore aggiornato prima di procedere. |
reconciling |
Solo output. Indica se questa CustomClass è in fase di aggiornamento. |
kms_key_name |
Solo output. Il nome della chiave KMS con cui è criptata CustomClass. Il formato previsto è |
kms_key_version_name |
Solo output. Il nome della versione della chiave KMS con cui è criptata CustomClass. Il formato previsto è |
ClassItem
Un elemento della classe.
| Campi | |
|---|---|
value |
Il valore dell'elemento della classe. |
Stato
Insieme di stati che definiscono il ciclo di vita di una CustomClass.
| Enum | |
|---|---|
STATE_UNSPECIFIED |
Stato non specificato. Questo valore viene utilizzato/è utile solo per distinguere i valori non impostati. |
ACTIVE |
Lo stato normale e attivo. |
DELETED |
Questa CustomClass è stata eliminata. |
DeleteCustomClassRequest
Messaggio di richiesta per il metodo DeleteCustomClass.
| Campi | |
|---|---|
name |
Obbligatorio. Il nome di CustomClass da eliminare. Formato: |
validate_only |
Se impostato, convalida la richiesta e visualizza l'anteprima di CustomClass eliminato, ma non eliminarlo effettivamente. |
allow_missing |
Se impostato su true e CustomClass non viene trovato, la richiesta andrà a buon fine e non verrà eseguita alcuna operazione (in questo caso non viene registrata alcuna operazione). |
etag |
Questo checksum viene calcolato dal server in base al valore di altri campi. Questo valore può essere inviato nelle richieste di aggiornamento, ripristino ed eliminazione per garantire che il client disponga di un valore aggiornato prima di procedere. |
DeletePhraseSetRequest
Messaggio di richiesta per il metodo DeletePhraseSet.
| Campi | |
|---|---|
name |
Obbligatorio. Il nome del PhraseSet da eliminare. Formato: |
validate_only |
Se impostato, convalida la richiesta e visualizza l'anteprima di PhraseSet eliminato, ma non eliminarlo effettivamente. |
allow_missing |
Se viene impostato su true e PhraseSet non viene trovato, la richiesta andrà a buon fine e non verrà eseguita alcuna operazione (in questo caso non viene registrata alcuna operazione). |
etag |
Questo checksum viene calcolato dal server in base al valore di altri campi. Questo valore può essere inviato nelle richieste di aggiornamento, ripristino ed eliminazione per garantire che il client disponga di un valore aggiornato prima di procedere. |
DeleteRecognizerRequest
Messaggio di richiesta per il metodo DeleteRecognizer.
| Campi | |
|---|---|
name |
Obbligatorio. Il nome del riconoscitore da eliminare. Formato: |
validate_only |
Se impostato, convalida la richiesta e visualizza l'anteprima del riconoscitore eliminato, ma non eliminarlo effettivamente. |
allow_missing |
Se viene impostato su true e il riconoscitore non viene trovato, la richiesta andrà a buon fine e non verrà eseguita alcuna operazione (in questo caso non viene registrata alcuna operazione). |
etag |
Questo checksum viene calcolato dal server in base al valore di altri campi. Questo valore può essere inviato nelle richieste di aggiornamento, ripristino ed eliminazione per garantire che il client disponga di un valore aggiornato prima di procedere. |
DenoiserConfig
Configurazione del riduttore del rumore. Potrebbe non essere supportata per tutti i modelli e potrebbe non avere alcun effetto.
| Campi | |
|---|---|
denoise_audio |
Riduci il rumore dell'audio prima di inviarlo al modello di trascrizione. |
snr_threshold |
Soglia del rapporto segnale/rumore (SNR) per il denoiser. In questo caso, SNR indica il volume del segnale vocale. L'audio con un SNR inferiore a questa soglia, il che significa che il parlato è troppo basso, non verrà inviato al modello di trascrizione. Se snr_threshold=0, non verrà applicato alcun filtro. |
ExplicitDecodingConfig
Parametri di decodifica specificati in modo esplicito.
| Campi | |
|---|---|
encoding |
Obbligatorio. Codifica dei dati audio inviati per il riconoscimento. |
sample_rate_hertz |
Facoltativo. Frequenza di campionamento in hertz dei dati audio inviati per il riconoscimento. I valori validi sono: 8000-48000 e 16000 è il valore ottimale. Per ottenere risultati ottimali, imposta la frequenza di campionamento della sorgente audio su 16000 Hz. Se non è possibile, utilizza la frequenza di campionamento nativa della sorgente audio (anziché il ricampionamento). Tieni presente che questo campo è contrassegnato come FACOLTATIVO per motivi di compatibilità con le versioni precedenti. È (e lo è sempre stato) effettivamente OBBLIGATORIO. |
audio_channel_count |
Facoltativo. Numero di canali presenti nei dati audio inviati per il riconoscimento. Tieni presente che questo campo è contrassegnato come FACOLTATIVO per motivi di compatibilità con le versioni precedenti. È (e lo è sempre stato) effettivamente OBBLIGATORIO. Il valore massimo consentito è 8. |
AudioEncoding
Codifiche dei dati audio supportate.
| Enum | |
|---|---|
AUDIO_ENCODING_UNSPECIFIED |
Valore predefinito. Questo valore non viene utilizzato. |
LINEAR16 |
Campioni PCM little-endian firmati a 16 bit senza intestazione. |
MULAW |
Campioni mulaw compressi a 8 bit senza intestazione. |
ALAW |
Campioni alaw compressi a 8 bit senza intestazione. |
AMR |
Frame AMR con un'intestazione rfc4867.5. |
AMR_WB |
Frame AMR-WB con un'intestazione rfc4867.5. |
FLAC |
Frame FLAC nel formato contenitore "FLAC nativo". |
MP3 |
Frame audio MPEG con metadati ID3 facoltativi (ignorati). |
OGG_OPUS |
Frame audio Opus in un container Ogg. |
WEBM_OPUS |
Frame audio Opus in un container WebM. |
MP4_AAC |
Frame audio AAC in un container MP4. |
M4A_AAC |
Frame audio AAC in un container M4A. |
MOV_AAC |
Frame audio AAC in un container MOV. |
GcsOutputConfig
Configurazioni di output per Cloud Storage.
| Campi | |
|---|---|
uri |
Il prefisso URI Cloud Storage con cui verranno scritti i risultati del riconoscimento. |
GetConfigRequest
Messaggio di richiesta per il metodo GetConfig.
| Campi | |
|---|---|
name |
Obbligatorio. Il nome della configurazione da recuperare. Esiste esattamente una risorsa di configurazione per progetto per località. Il formato previsto è |
GetCustomClassRequest
Messaggio di richiesta per il metodo GetCustomClass.
| Campi | |
|---|---|
name |
Obbligatorio. Il nome di CustomClass da recuperare. Il formato previsto è |
GetPhraseSetRequest
Messaggio di richiesta per il metodo GetPhraseSet.
| Campi | |
|---|---|
name |
Obbligatorio. Il nome del PhraseSet da recuperare. Il formato previsto è |
GetRecognizerRequest
Messaggio di richiesta per il metodo GetRecognizer.
| Campi | |
|---|---|
name |
Obbligatorio. Il nome del riconoscitore da recuperare. Il formato previsto è |
InlineOutputConfig
Questo tipo non contiene campi.
Configurazioni di output per la risposta in linea.
InlineResult
I risultati finali vengono restituiti in linea nella risposta di riconoscimento.
| Campi | |
|---|---|
transcript |
La trascrizione del file audio. |
vtt_captions |
La trascrizione del file audio come sottotitoli codificati in formato VTT. Questo campo viene compilato solo quando viene richiesto l'output |
srt_captions |
La trascrizione del file audio come sottotitoli codificati in formato SRT. Questo campo viene compilato solo quando viene richiesto l'output |
LanguageMetadata
I metadati relativi alle impostazioni internazionali disponibili in una determinata regione. Al momento, si tratta solo dei modelli disponibili per ogni impostazione regionale
| Campi | |
|---|---|
models |
Mappa delle impostazioni internazionali (codice lingua) -> modelli |
ListCustomClassesRequest
Messaggio di richiesta per il metodo ListCustomClasses.
| Campi | |
|---|---|
parent |
Obbligatorio. Il progetto e la posizione delle risorse CustomClass da elencare. Il formato previsto è |
page_size |
Numero di risultati per richiesta. Un valore valido per page_size è compreso tra 0 e 100 (incluso). Se page_size è zero o non specificato, verrà scelta una dimensione della pagina pari a 5. Se le dimensioni della pagina superano 100, verranno ridotte a 100. Tieni presente che una chiamata potrebbe restituire meno risultati rispetto alle dimensioni della pagina richieste. |
page_token |
Un token di pagina ricevuto da una precedente chiamata Durante la paginazione, tutti gli altri parametri forniti a |
show_deleted |
Indica se mostrare o meno le risorse eliminate. |
ListCustomClassesResponse
Messaggio di risposta per il metodo ListCustomClasses.
| Campi | |
|---|---|
custom_classes[] |
L'elenco delle CustomClass richieste. |
next_page_token |
Un token, che può essere inviato come |
ListPhraseSetsRequest
Messaggio di richiesta per il metodo ListPhraseSets.
| Campi | |
|---|---|
parent |
Obbligatorio. Il progetto e la posizione delle risorse PhraseSet da elencare. Il formato previsto è |
page_size |
Il numero massimo di PhraseSet da restituire. Il servizio potrebbe restituire un numero inferiore a questo valore. Se non specificato, verranno restituiti al massimo 5 PhraseSet. Il valore massimo è 100; i valori superiori a 100 verranno forzati a 100. |
page_token |
Un token di pagina ricevuto da una precedente chiamata Durante la paginazione, tutti gli altri parametri forniti a |
show_deleted |
Indica se mostrare o meno le risorse eliminate. |
ListPhraseSetsResponse
Messaggio di risposta per il metodo ListPhraseSets.
| Campi | |
|---|---|
phrase_sets[] |
L'elenco dei PhraseSet richiesti. |
next_page_token |
Un token, che può essere inviato come |
ListRecognizersRequest
Messaggio di richiesta per il metodo ListRecognizers.
| Campi | |
|---|---|
parent |
Obbligatorio. Il progetto e la posizione dei riconoscitori da elencare. Il formato previsto è |
page_size |
Il numero massimo di Recognizer da restituire. Il servizio potrebbe restituire un numero inferiore a questo valore. Se non specificato, verranno restituiti al massimo 5 riconoscitori. Il valore massimo è 100; i valori superiori a 100 verranno forzati a 100. |
page_token |
Un token di pagina ricevuto da una precedente chiamata Durante la paginazione, tutti gli altri parametri forniti a |
show_deleted |
Indica se mostrare o meno le risorse eliminate. |
ListRecognizersResponse
Messaggio di risposta per il metodo ListRecognizers.
| Campi | |
|---|---|
recognizers[] |
L'elenco dei Recognizer richiesti. |
next_page_token |
Un token, che può essere inviato come |
LocationsMetadata
Metadati principali per l'API Locations per STT V2. Al momento si tratta solo dei metadati relativi a impostazioni internazionali, modelli e funzionalità
| Campi | |
|---|---|
languages |
Informazioni su impostazioni internazionali, modelli e funzionalità disponibili rappresentati nella struttura gerarchica di impostazioni internazionali -> modelli -> funzionalità |
access_metadata |
Informazioni sui metadati di accesso per la regione e il progetto specificati. |
ModelFeature
Rappresenta una singola caratteristica di un modello. Se la funzionalità è recognizer, release_state della funzionalità rappresenta release_state del modello
| Campi | |
|---|---|
feature |
Il nome della funzionalità (nota: la funzionalità può essere |
release_state |
Lo stato di rilascio della funzionalità |
ModelFeatures
Rappresenta la raccolta di funzionalità appartenenti a un modello
| Campi | |
|---|---|
model_feature[] |
Campo ripetuto che contiene tutte le funzionalità del modello |
ModelMetadata
I metadati sui modelli in una determinata regione per una località specifica. Al momento, queste sono solo le funzionalità del modello
| Campi | |
|---|---|
model_features |
Mappa del nome del modello -> funzionalità del modello |
NativeOutputFileFormatConfig
Questo tipo non contiene campi.
Configurazioni di output per i proto BatchRecognizeResults serializzati.
OperationMetadata
Rappresenta i metadati di un'operazione a lunga esecuzione.
| Campi | |
|---|---|
create_time |
L'ora in cui è stata creata l'operazione. |
update_time |
Ora dell'ultimo aggiornamento dell'operazione. |
resource |
Il percorso della risorsa per la destinazione dell'operazione. |
method |
Il metodo che ha attivato l'operazione. |
kms_key_name |
Il nome della chiave KMS con cui viene criptato il contenuto dell'operazione. Il formato previsto è |
kms_key_version_name |
Il nome della versione della chiave KMS con cui viene criptato il contenuto dell'operazione. Il formato previsto è |
progress_percent |
La percentuale di avanzamento dell'operazione. I valori possono variare da 0 a 100. Se il valore è 100, l'operazione è terminata. |
Campo unione request. La richiesta che ha generato l'operazione. request può essere solo uno dei seguenti: |
|
batch_recognize_request |
BatchRecognizeRequest che ha generato l'operazione. |
create_recognizer_request |
CreateRecognizerRequest che ha generato l'operazione. |
update_recognizer_request |
UpdateRecognizerRequest che ha generato l'operazione. |
delete_recognizer_request |
DeleteRecognizerRequest che ha generato l'operazione. |
undelete_recognizer_request |
UndeleteRecognizerRequest che ha generato l'operazione. |
create_custom_class_request |
CreateCustomClassRequest che ha generato l'operazione. |
update_custom_class_request |
UpdateCustomClassRequest che ha generato l'operazione. |
delete_custom_class_request |
DeleteCustomClassRequest che ha generato l'operazione. |
undelete_custom_class_request |
L'oggetto UndeleteCustomClassRequest che ha generato l'operazione. |
create_phrase_set_request |
CreatePhraseSetRequest che ha generato l'operazione. |
update_phrase_set_request |
UpdatePhraseSetRequest che ha generato l'operazione. |
delete_phrase_set_request |
La richiesta DeletePhraseSetRequest che ha generato l'operazione. |
undelete_phrase_set_request |
L'oggetto UndeletePhraseSetRequest che ha generato l'operazione. |
update_config_request |
UpdateConfigRequest che ha generato l'operazione. |
Campo unione metadata. Metadati specifici per RPC. metadata può essere solo uno dei seguenti: |
|
batch_recognize_metadata |
Metadati specifici del metodo BatchRecognize. |
OutputFormatConfig
Configurazione del formato dei risultati archiviati in output.
| Campi | |
|---|---|
native |
Configurazione per il formato di output nativo. Se questo campo è impostato o se non è impostato nessun altro campo del formato di output, le trascrizioni verranno scritte nel sink nel formato nativo. |
vtt |
Configurazione per il formato di output VTT. Se questo campo è impostato, le trascrizioni verranno scritte nel sink in formato VTT. |
srt |
Configurazione per il formato di output SRT. Se questo campo è impostato, le trascrizioni verranno scritte nel sink in formato SRT. |
PhraseSet
PhraseSet per la distorsione nel riconoscimento vocale. Un PhraseSet viene utilizzato per fornire "suggerimenti" al riconoscimento vocale per privilegiare parole e frasi specifiche nei risultati.
| Campi | |
|---|---|
name |
Solo output. Identificatore. Il nome della risorsa di PhraseSet. Formato: |
uid |
Solo output. Identificatore univoco assegnato dal sistema per il PhraseSet. |
phrases[] |
Un elenco di parole e frasi. |
boost |
Suggerimento potenziato. Un valore positivo aumenterà la probabilità che una frase specifica venga riconosciuta rispetto ad altre frasi dal suono simile. Più alto è l'incremento, maggiore è la probabilità di un falso positivo. I valori validi di |
display_name |
Nome leggibile e impostabile dall'utente per il PhraseSet. Deve contenere al massimo 63 caratteri. |
state |
Solo output. Lo stato del ciclo di vita di PhraseSet. |
create_time |
Solo output. Data/ora creazione. |
update_time |
Solo output. L'ultima volta che questa risorsa è stata modificata. |
delete_time |
Solo output. L'ora in cui è stata richiesta l'eliminazione di questa risorsa. |
expire_time |
Solo output. L'ora in cui verrà eliminata questa risorsa. |
annotations |
Consente agli utenti di memorizzare piccole quantità di dati arbitrari. Sia la chiave che il valore devono contenere al massimo 63 caratteri ciascuno. Al massimo 100 annotazioni. |
etag |
Solo output. Questo checksum viene calcolato dal server in base al valore di altri campi. Questo valore può essere inviato nelle richieste di aggiornamento, ripristino ed eliminazione per garantire che il client disponga di un valore aggiornato prima di procedere. |
reconciling |
Solo output. Indica se questo PhraseSet è in fase di aggiornamento. |
kms_key_name |
Solo output. Il nome della chiave KMS con cui è criptato il PhraseSet. Il formato previsto è |
kms_key_version_name |
Solo output. Il nome della versione della chiave KMS con cui è criptato il PhraseSet. Il formato previsto è |
Frase
Una frase contiene parole e "suggerimenti" per le frasi, in modo che il riconoscimento vocale abbia maggiori probabilità di riconoscerle. Può essere utilizzata per migliorare l'accuratezza di parole e frasi specifiche, ad esempio se l'utente pronuncia in genere comandi specifici. Può essere utilizzato anche per aggiungere altre parole al vocabolario del sistema di riconoscimento.
Gli elementi dell'elenco possono includere anche riferimenti CustomClass contenenti gruppi di parole che rappresentano concetti comuni che si verificano nel linguaggio naturale.
| Campi | |
|---|---|
value |
La frase stessa. |
boost |
Suggerimento potenziato. Sostituisce il boost impostato a livello di set di frasi. Un valore positivo aumenterà la probabilità che una frase specifica venga riconosciuta rispetto ad altre frasi dal suono simile. Più alto è l'incremento, maggiore è la probabilità di un falso positivo. I valori di boosting negativi corrispondono all'anti-bias. L'aggiustamento per ridurre i bias non è attivato, pertanto i valori di incremento negativi restituiranno un errore. I valori boost devono essere compresi tra 0 e 20. Qualsiasi valore al di fuori di questo intervallo restituirà un errore. Ti consigliamo di utilizzare un approccio di ricerca binaria per trovare il valore ottimale per il tuo caso d'uso, nonché di aggiungere frasi con e senza boost alle tue richieste. |
Stato
Insieme di stati che definiscono il ciclo di vita di un PhraseSet.
| Enum | |
|---|---|
STATE_UNSPECIFIED |
Stato non specificato. Questo valore viene utilizzato/è utile solo per distinguere i valori non impostati. |
ACTIVE |
Lo stato normale e attivo. |
DELETED |
Questo PhraseSet è stato eliminato. |
RecognitionConfig
Fornisce informazioni al Recognizer che specificano come elaborare la richiesta di riconoscimento.
| Campi | |
|---|---|
model |
Facoltativo. Quale modello utilizzare per le richieste di riconoscimento. Seleziona il modello più adatto al tuo dominio per ottenere risultati ottimali. Le indicazioni per la scelta del modello da utilizzare sono disponibili nella documentazione sui modelli di trascrizione, mentre i modelli supportati in ogni regione sono disponibili nella tabella dei modelli supportati. |
language_codes[] |
Facoltativo. La lingua dell'audio fornito come tag lingua BCP-47. I tag di lingua vengono normalizzati in BCP-47 prima di essere utilizzati, ad esempio "en-us" diventa "en-US". Le lingue supportate per ogni modello sono elencate nella tabella dei modelli supportati. Se vengono fornite lingue aggiuntive, il risultato del riconoscimento conterrà il riconoscimento nella lingua più probabile rilevata. Il risultato del riconoscimento includerà il tag della lingua rilevata nell'audio. |
features |
Funzionalità di riconoscimento vocale da attivare. |
adaptation |
Contesto di adattamento vocale che pondera le previsioni del sistema di riconoscimento per parole e frasi specifiche. |
transcript_normalization |
Facoltativo. Utilizza la normalizzazione della trascrizione per sostituire automaticamente parti della trascrizione con frasi a tua scelta. Per StreamingRecognize, questa normalizzazione si applica solo alle trascrizioni parziali stabili (stabilità > 0,8) e alle trascrizioni finali. |
translation_config |
Facoltativo. Configurazione facoltativa utilizzata per eseguire automaticamente la traduzione dell'audio specificato nella lingua desiderata per i modelli supportati. |
denoiser_config |
Facoltativo. (Facoltativo) Configurazione del riduttore del rumore. Potrebbe non essere supportata per tutti i modelli e potrebbe non avere alcun effetto. |
Campo unione decoding_config. Parametri di decodifica per l'audio inviato per il riconoscimento. decoding_config può essere solo uno dei seguenti: |
|
auto_decoding_config |
Rileva automaticamente i parametri di decodifica. Preferito per i formati supportati. |
explicit_decoding_config |
Parametri di decodifica specificati in modo esplicito. Obbligatorio se utilizzi l'audio PCM senza intestazione (linear16, mulaw, alaw). |
RecognitionFeatures
Funzionalità di riconoscimento disponibili.
| Campi | |
|---|---|
profanity_filter |
Se impostato su |
enable_word_time_offsets |
Se |
enable_word_confidence |
Se |
enable_automatic_punctuation |
Se |
enable_spoken_punctuation |
Il comportamento della punteggiatura vocale per la chiamata. Se |
enable_spoken_emojis |
Il comportamento delle emoji vocali per la chiamata. Se |
multi_channel_mode |
Modalità per il riconoscimento dell'audio multicanale. |
diarization_config |
Configurazione per abilitare la diarizzazione degli interlocutori. Per attivare la diarizzazione, imposta questo campo su un messaggio SpeakerDiarizationConfig vuoto. |
max_alternatives |
Il numero massimo di ipotesi di riconoscimento da restituire. Il server potrebbe restituire meno di |
MultiChannelMode
Opzioni per il riconoscimento dell'audio multicanale.
| Enum | |
|---|---|
MULTI_CHANNEL_MODE_UNSPECIFIED |
Valore predefinito per la modalità multicanale. Se l'audio contiene più canali, verrà trascritto solo il primo, mentre gli altri verranno ignorati. |
SEPARATE_RECOGNITION_PER_CHANNEL |
Se selezionato, ogni canale dell'audio fornito viene trascritto in modo indipendente. Questa opzione non può essere selezionata se il model selezionato è latest_short. |
RecognitionOutputConfig
Opzioni di configurazione per l'output o gli output del riconoscimento.
| Campi | |
|---|---|
output_format_config |
Facoltativo. Configurazione del formato dei risultati archiviati in |
Campo unione
|
|
gcs_output_config |
Se questo messaggio viene compilato, i risultati del riconoscimento vengono scritti nell'URI Google Cloud Storage fornito. |
inline_response_config |
Se questo messaggio viene compilato, i risultati del riconoscimento vengono forniti nel messaggio |
RecognitionResponseMetadata
Metadati relativi alla richiesta e alla risposta di riconoscimento.
| Campi | |
|---|---|
request_id |
Identificatore di richiesta globale generato automaticamente dall'API. |
total_billed_duration |
Se disponibili, i secondi di audio fatturati per la richiesta corrispondente. |
RecognizeRequest
Messaggio di richiesta per il metodo Recognize. È necessario fornire content o uri. Se fornisci entrambi o nessuno dei due valori, viene restituito INVALID_ARGUMENT. Consulta i limiti dei contenuti.
| Campi | |
|---|---|
recognizer |
Obbligatorio. Il nome del riconoscitore da utilizzare durante il riconoscimento. Il formato previsto è |
config |
Funzionalità e metadati audio da utilizzare per il riconoscimento vocale automatico. Questo campo, in combinazione con il campo |
config_mask |
L'elenco dei campi in |
Campo unione audio_source. L'origine audio, che è un contenuto incorporato o un URI Google Cloud Storage. audio_source può essere solo uno dei seguenti: |
|
content |
I byte di dati audio codificati come specificato in |
uri |
URI che rimanda a un file contenente i byte di dati audio specificati in |
RecognizeResponse
Messaggio di risposta per il metodo Recognize.
| Campi | |
|---|---|
results[] |
Elenco sequenziale dei risultati della trascrizione corrispondenti alle porzioni sequenziali dell'audio. |
metadata |
Metadati relativi al riconoscimento. |
Riconoscimento
Un messaggio di Riconoscimento. Archivia la configurazione e i metadati del riconoscimento.
| Campi | |
|---|---|
name |
Solo output. Identificatore. Il nome della risorsa del riconoscitore. Formato: |
uid |
Solo output. Identificatore univoco assegnato dal sistema per il riconoscitore. |
display_name |
Nome leggibile e impostabile dall'utente per il riconoscitore. Deve contenere al massimo 63 caratteri. |
model |
Facoltativo. Questo campo è ora deprecato. Preferisci il campo Quale modello utilizzare per le richieste di riconoscimento. Seleziona il modello più adatto al tuo dominio per ottenere risultati ottimali. Le indicazioni per la scelta del modello da utilizzare sono disponibili nella documentazione sui modelli di trascrizione, mentre i modelli supportati in ogni regione sono disponibili nella tabella dei modelli supportati. |
language_codes[] |
Facoltativo. Questo campo è ora deprecato. Preferisci il campo La lingua dell'audio fornito come tag lingua BCP-47. Le lingue supportate per ogni modello sono elencate nella tabella dei modelli supportati. Se vengono fornite lingue aggiuntive, il risultato del riconoscimento conterrà il riconoscimento nella lingua più probabile rilevata. Il risultato del riconoscimento includerà il tag della lingua rilevata nell'audio. Quando crei o aggiorni un riconoscitore, questi valori vengono memorizzati in formato BCP-47 normalizzato. Ad esempio, "en-us" viene memorizzato come "en-US". |
default_recognition_config |
Configurazione predefinita da utilizzare per le richieste con questo riconoscimento. Questa impostazione può essere sovrascritta dalla configurazione in linea nel campo |
annotations |
Consente agli utenti di memorizzare piccole quantità di dati arbitrari. Sia la chiave che il valore devono contenere al massimo 63 caratteri ciascuno. Al massimo 100 annotazioni. |
state |
Solo output. Lo stato del ciclo di vita del riconoscitore. |
create_time |
Solo output. Data/ora creazione. |
update_time |
Solo output. L'ultima volta che questo riconoscitore è stato modificato. |
delete_time |
Solo output. L'ora in cui è stata richiesta l'eliminazione di questo riconoscitore. |
expire_time |
Solo output. L'ora in cui questo riconoscitore verrà eliminato. |
etag |
Solo output. Questo checksum viene calcolato dal server in base al valore di altri campi. Questo valore può essere inviato nelle richieste di aggiornamento, ripristino ed eliminazione per garantire che il client disponga di un valore aggiornato prima di procedere. |
reconciling |
Solo output. Indica se questo Recognizer è in fase di aggiornamento. |
kms_key_name |
Solo output. Il nome della chiave KMS con cui viene criptato il riconoscitore. Il formato previsto è |
kms_key_version_name |
Solo output. Il nome della versione della chiave KMS con cui viene criptato il riconoscitore. Il formato previsto è |
Stato
Insieme di stati che definiscono il ciclo di vita di un riconoscitore.
| Enum | |
|---|---|
STATE_UNSPECIFIED |
Il valore predefinito. Questo valore viene utilizzato se lo stato viene omesso. |
ACTIVE |
Il Riconoscitore è attivo e pronto per l'uso. |
DELETED |
Questo riconoscitore è stato eliminato. |
SpeakerDiarizationConfig
Configurazione per abilitare la diarizzazione degli interlocutori.
| Campi | |
|---|---|
min_speaker_count |
Facoltativo. Il sistema determina automaticamente il numero di speaker. Questo valore non è attualmente utilizzato. |
max_speaker_count |
Facoltativo. Il sistema determina automaticamente il numero di speaker. Questo valore non è attualmente utilizzato. |
SpeechAdaptation
Fornisce al riconoscimento vocale "suggerimenti" che privilegiano parole e frasi specifiche nei risultati. PhraseSets può essere specificato come risorsa incorporata o come riferimento a una risorsa PhraseSet esistente.
| Campi | |
|---|---|
phrase_sets[] |
Un elenco di PhraseSet incorporati o a cui viene fatto riferimento. |
custom_classes[] |
Un elenco di CustomClass inline. È possibile fare riferimento direttamente alle risorse CustomClass esistenti in un PhraseSet. |
AdaptationPhraseSet
Un PhraseSet di distorsione, che può essere una stringa che fa riferimento al nome di una risorsa PhraseSets esistente o una definizione incorporata di un PhraseSet.
| Campi | |
|---|---|
Campo unione
|
|
phrase_set |
Il nome di una risorsa PhraseSet esistente. L'utente deve disporre dell'accesso in lettura alla risorsa e questa non deve essere eliminata. |
inline_phrase_set |
Un PhraseSet definito in linea. |
SpeechRecognitionAlternative
Ipotesi alternative (ovvero elenco n-best).
| Campi | |
|---|---|
transcript |
Testo della trascrizione che rappresenta le parole pronunciate dall'utente. |
confidence |
La stima di confidenza compresa tra 0,0 e 1,0. Un numero più alto indica una maggiore probabilità stimata che le parole riconosciute siano corrette. Questo campo è impostato solo per l'alternativa principale di un risultato non in streaming o di un risultato in streaming in cui |
words[] |
Un elenco di informazioni specifiche per ogni parola riconosciuta. Quando |
SpeechRecognitionResult
Un risultato del riconoscimento vocale corrispondente a una parte dell'audio.
| Campi | |
|---|---|
alternatives[] |
Può contenere una o più ipotesi di riconoscimento. Queste alternative sono ordinate in termini di precisione, con l'alternativa in alto (la prima) che è la più probabile, in base alla classificazione del sistema di riconoscimento. |
channel_tag |
Per l'audio multicanale, questo è il numero del canale corrispondente al risultato riconosciuto per l'audio di quel canale. Per |
result_end_offset |
Offset temporale della fine di questo risultato rispetto all'inizio dell'audio. |
language_code |
Solo output. Il tag lingua BCP-47 della lingua in questo risultato. È stato rilevato che questo codice di lingua è quello con la maggiore probabilità di essere parlato nell'audio. |
SrtOutputFileFormatConfig
Questo tipo non contiene campi.
File di sottotitoli formattato SubRip Text.
StreamingRecognitionConfig
Fornisce informazioni di configurazione per la richiesta StreamingRecognize.
| Campi | |
|---|---|
config |
Obbligatorio. Funzionalità e metadati audio da utilizzare per il riconoscimento vocale automatico. Questo campo, in combinazione con il campo |
config_mask |
L'elenco dei campi in |
streaming_features |
Funzionalità di riconoscimento vocale da abilitare per richieste specifiche di riconoscimento audio in streaming. |
StreamingRecognitionFeatures
Funzionalità di riconoscimento disponibili specifiche per le richieste di riconoscimento dello streaming.
| Campi | |
|---|---|
enable_voice_activity_events |
Se |
interim_results |
Se trasmettere o meno i risultati provvisori al cliente. Se impostato su true, i risultati provvisori verranno trasmessi in streaming al client. In caso contrario, verrà restituita solo la risposta finale. |
voice_activity_timeout |
Se impostato, il server chiuderà automaticamente lo stream dopo che è trascorsa la durata specificata dall'invio dell'ultimo evento vocale VOICE_ACTIVITY. Anche il campo |
VoiceActivityTimeout
Eventi per i quali è possibile impostare un timeout per l'attività vocale.
| Campi | |
|---|---|
speech_start_timeout |
Durata del timeout dello stream se non inizia alcun discorso. Se questo valore è impostato e non viene rilevato alcun discorso in questo periodo di tempo all'inizio dello stream, il server chiuderà lo stream. |
speech_end_timeout |
Durata del timeout dello stream dopo la fine del discorso. Se questo valore è impostato e non viene rilevato alcun discorso in questo periodo di tempo dopo che è stato rilevato un discorso, il server chiuderà lo stream. |
StreamingRecognitionResult
Un risultato del riconoscimento vocale di audio in streaming corrispondente a una parte dell'audio in fase di elaborazione.
| Campi | |
|---|---|
alternatives[] |
Può contenere una o più ipotesi di riconoscimento. Queste alternative sono ordinate in termini di precisione, con l'alternativa in alto (la prima) che è la più probabile, in base alla classificazione del sistema di riconoscimento. |
is_final |
Se |
stability |
Una stima della probabilità che il sistema di riconoscimento non modifichi la sua ipotesi su questo risultato intermedio. I valori vanno da 0,0 (completamente instabile) a 1,0 (completamente stabile). Questo campo viene fornito solo per i risultati provvisori ( |
result_end_offset |
Offset temporale della fine di questo risultato rispetto all'inizio dell'audio. |
channel_tag |
Per l'audio multicanale, questo è il numero del canale corrispondente al risultato riconosciuto per l'audio di quel canale. Per |
language_code |
Solo output. Il tag lingua BCP-47 della lingua in questo risultato. È stato rilevato che questo codice di lingua è quello con la maggiore probabilità di essere parlato nell'audio. |
StreamingRecognizeRequest
Messaggio di richiesta per il metodo StreamingRecognize. Più messaggi StreamingRecognizeRequest vengono inviati in una sola chiamata.
Se Recognizer a cui fa riferimento recognizer contiene una configurazione della richiesta completamente specificata, lo stream può contenere solo messaggi con audio impostato.
In caso contrario, il primo messaggio deve contenere un messaggio recognizer e un messaggio streaming_config che insieme specificano completamente la configurazione della richiesta e non devono contenere audio. Tutti i messaggi successivi devono avere impostato solo audio.
| Campi | |
|---|---|
recognizer |
Obbligatorio. Il nome del riconoscitore da utilizzare durante il riconoscimento. Il formato previsto è |
Campo unione
|
|
streaming_config |
StreamingRecognitionConfig da utilizzare in questo tentativo di riconoscimento. Se fornita, sostituirà la RecognitionConfig predefinita archiviata nel riconoscitore. |
audio |
Byte audio incorporati da riconoscere. La dimensione massima per questo campo è 15 kB per richiesta. |
StreamingRecognizeResponse
StreamingRecognizeResponse è l'unico messaggio restituito al client da StreamingRecognize. Una serie di zero o più messaggi StreamingRecognizeResponse vengono trasmessi in streaming al client. Se non è presente audio riconoscibile, nessun messaggio viene trasmesso in streaming al client.
Ecco alcuni esempi di StreamingRecognizeResponse che potrebbero essere restituiti durante l'elaborazione dell'audio:
results { alternatives { transcript: "tubo" } stability: 0.01 }
results { alternatives { transcript: "to be a" } stability: 0.01 }
results { alternatives { transcript: "to be" } stability: 0.9 } results { alternatives { transcript: " or not to be" } stability: 0.01 }
results { alternatives { transcript: "to be or not to be" confidence: 0.92 } alternatives { transcript: "to bee or not to bee" } is_final: true }
results { alternatives { transcript: " that's" } stability: 0.01 }
results { alternatives { transcript: " that is" } stability: 0.9 } results { alternatives { transcript: " the question" } stability: 0.01 }
results { alternatives { transcript: " that is the question" confidence: 0.98 } alternatives { transcript: " that was the question" } is_final: true }
Note:
Solo due delle risposte precedenti, la 4 e la 7, contengono i risultati finali, indicati da
is_final: true. La concatenazione di questi elementi genera la trascrizione completa: "Essere o non essere, questo è il problema".Gli altri contengono
resultsprovvisori. I numeri 3 e 6 contengono dueresultsprovvisori: la prima parte ha un'elevata stabilità ed è meno probabile che cambi; la seconda parte ha una bassa stabilità ed è molto probabile che cambi. Un UI designer potrebbe scegliere di mostrare soloresultscon stabilità elevata.I valori specifici di
stabilityeconfidencemostrati sopra sono solo a scopo illustrativo. I valori effettivi possono variare.In ogni risposta, verrà impostato solo uno di questi campi:
error,speech_event_typeo uno o più campiresults(ripetuti).
| Campi | |
|---|---|
results[] |
Questo elenco ripetuto contiene zero o più risultati che corrispondono a porzioni consecutive dell'audio attualmente in elaborazione. Contiene zero o un risultato |
speech_event_type |
Indica il tipo di evento vocale. |
speech_event_offset |
Offset temporale tra l'inizio dell'audio e l'emissione dell'evento. |
metadata |
Metadati relativi al riconoscimento. |
SpeechEventType
Indica il tipo di evento vocale.
| Enum | |
|---|---|
SPEECH_EVENT_TYPE_UNSPECIFIED |
Nessun evento vocale specificato. |
END_OF_SINGLE_UTTERANCE |
Questo evento indica che il server ha rilevato la fine dell'espressione vocale dell'utente e non prevede ulteriori input vocali. Pertanto, il server non elaborerà audio aggiuntivo e chiuderà lo stream bidirezionale gRPC. Questo evento viene inviato solo se si è verificato un taglio forzato a causa del rilevamento anticipato del silenzio. Questo evento è disponibile solo tramite latest_short model. |
SPEECH_ACTIVITY_BEGIN |
Questo evento indica che il server ha rilevato l'inizio dell'attività vocale umana nel flusso. Questo evento può essere restituito più volte se il parlato inizia e si interrompe ripetutamente durante lo stream. Questo evento viene inviato solo se voice_activity_events è impostato su true. |
SPEECH_ACTIVITY_END |
Questo evento indica che il server ha rilevato la fine dell'attività vocale umana nello stream. Questo evento può essere restituito più volte se il parlato inizia e si interrompe ripetutamente durante lo stream. Questo evento viene inviato solo se voice_activity_events è impostato su true. |
TranscriptNormalization
Configurazione della normalizzazione della trascrizione. Utilizza la normalizzazione della trascrizione per sostituire automaticamente parti della trascrizione con frasi a tua scelta. Per StreamingRecognize, questa normalizzazione si applica solo alle trascrizioni parziali stabili (stabilità > 0,8) e alle trascrizioni finali.
| Campi | |
|---|---|
entries[] |
Un elenco di voci di sostituzione. Eseguiremo la sostituzione con una voce alla volta. Ad esempio, la seconda voce di ["cat" => "dog", "mountain cat" => "mountain dog"] non verrà mai applicata perché elaboreremo sempre la prima voce prima. Al massimo 100 voci. |
Voce
Una singola configurazione di sostituzione.
| Campi | |
|---|---|
search |
Cosa sostituire. La lunghezza massima è di 100 caratteri. |
replace |
Con cosa sostituire. La lunghezza massima è di 100 caratteri. |
case_sensitive |
Indica se la ricerca è sensibile alle maiuscole. |
TranslationConfig
Configurazione della traduzione. Utilizzalo per tradurre l'audio fornito in testo nella lingua desiderata.
| Campi | |
|---|---|
target_language |
Obbligatorio. Il codice della lingua in cui tradurre. |
UndeleteCustomClassRequest
Messaggio di richiesta per il metodo UndeleteCustomClass.
| Campi | |
|---|---|
name |
Obbligatorio. Il nome di CustomClass da ripristinare. Formato: |
validate_only |
Se impostato, convalida la richiesta e visualizza l'anteprima di CustomClass eliminata, ma non ripristinarla. |
etag |
Questo checksum viene calcolato dal server in base al valore di altri campi. Questo valore può essere inviato nelle richieste di aggiornamento, ripristino ed eliminazione per garantire che il client disponga di un valore aggiornato prima di procedere. |
UndeletePhraseSetRequest
Messaggio di richiesta per il metodo UndeletePhraseSet.
| Campi | |
|---|---|
name |
Obbligatorio. Il nome del PhraseSet da recuperare. Formato: |
validate_only |
Se impostato, convalida la richiesta e visualizza l'anteprima del PhraseSet eliminato, ma non ripristinarlo. |
etag |
Questo checksum viene calcolato dal server in base al valore di altri campi. Questo valore può essere inviato nelle richieste di aggiornamento, ripristino ed eliminazione per garantire che il client disponga di un valore aggiornato prima di procedere. |
UndeleteRecognizerRequest
Messaggio di richiesta per il metodo UndeleteRecognizer.
| Campi | |
|---|---|
name |
Obbligatorio. Il nome del Recognizer da recuperare. Formato: |
validate_only |
Se impostato, convalida la richiesta e visualizza l'anteprima del riconoscitore eliminato, ma non ripristinarlo. |
etag |
Questo checksum viene calcolato dal server in base al valore di altri campi. Questo valore può essere inviato nelle richieste di aggiornamento, ripristino ed eliminazione per garantire che il client disponga di un valore aggiornato prima di procedere. |
UpdateConfigRequest
Messaggio di richiesta per il metodo UpdateConfig.
| Campi | |
|---|---|
config |
Obbligatorio. La configurazione da aggiornare. Il campo |
update_mask |
L'elenco dei campi da aggiornare. |
UpdateCustomClassRequest
Messaggio di richiesta per il metodo UpdateCustomClass.
| Campi | |
|---|---|
custom_class |
Obbligatorio. CustomClass da aggiornare. Il campo |
update_mask |
L'elenco dei campi da aggiornare. Se è vuoto, vengono presi in considerazione tutti i campi per l'aggiornamento. |
validate_only |
Se impostato, convalida la richiesta e visualizza l'anteprima di CustomClass aggiornata, ma non aggiornarla effettivamente. |
UpdatePhraseSetRequest
Messaggio di richiesta per il metodo UpdatePhraseSet.
| Campi | |
|---|---|
phrase_set |
Obbligatorio. Il PhraseSet da aggiornare. Il campo |
update_mask |
L'elenco dei campi da aggiornare. Se è vuoto, vengono presi in considerazione per l'aggiornamento tutti i campi con valori non predefiniti. Utilizza |
validate_only |
Se impostato, convalida la richiesta e visualizza l'anteprima del PhraseSet aggiornato, ma non aggiornarlo effettivamente. |
UpdateRecognizerRequest
Messaggio di richiesta per il metodo UpdateRecognizer.
| Campi | |
|---|---|
recognizer |
Obbligatorio. Il riconoscitore da aggiornare. Il campo |
update_mask |
L'elenco dei campi da aggiornare. Se è vuoto, vengono presi in considerazione per l'aggiornamento tutti i campi con valori non predefiniti. Utilizza |
validate_only |
Se impostato, convalida la richiesta e visualizza l'anteprima del riconoscitore aggiornato, ma non aggiornarlo effettivamente. |
VttOutputFileFormatConfig
Questo tipo non contiene campi.
Configurazioni di output per il file dei sottotitoli codificati nel formato WebVTT.
WordInfo
Informazioni specifiche per le parole riconosciute.
| Campi | |
|---|---|
start_offset |
Offset temporale relativo all'inizio dell'audio e corrispondente all'inizio della parola pronunciata. Questo campo viene impostato solo se |
end_offset |
Offset temporale relativo all'inizio dell'audio e corrispondente alla fine della parola pronunciata. Questo campo viene impostato solo se |
word |
La parola corrispondente a questo insieme di informazioni. |
confidence |
La stima di confidenza compresa tra 0,0 e 1,0. Un numero più alto indica una maggiore probabilità stimata che le parole riconosciute siano corrette. Questo campo è impostato solo per l'alternativa principale di un risultato non in streaming o di un risultato in streaming in cui |
speaker_label |
A ogni persona che parla nell'audio viene assegnata un'etichetta distinta. Questo campo specifica quale di questi oratori è stato rilevato mentre pronunciava questa parola. |