Package google.cloud.speech.v2

Indice

Voce

Consente la trascrizione vocale e la gestione delle risorse.

BatchRecognize

rpc BatchRecognize(BatchRecognizeRequest) returns (Operation)

Esegue il riconoscimento vocale asincrono batch: invia una richiesta con N file audio e ricevi un'operazione a lunga esecuzione che può essere sottoposta a polling per verificare quando le trascrizioni sono terminate.

Ambiti di autorizzazione

Richiede il seguente ambito OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Per ulteriori informazioni, consulta Authentication Overview.

Autorizzazioni IAM

Richiede la seguente autorizzazione IAM per la risorsa recognizer:

  • speech.recognizers.recognize

Per saperne di più, consulta la documentazione di IAM.

CreateCustomClass

rpc CreateCustomClass(CreateCustomClassRequest) returns (Operation)

Crea un CustomClass.

Ambiti di autorizzazione

Richiede il seguente ambito OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Per ulteriori informazioni, consulta Authentication Overview.

Autorizzazioni IAM

Richiede la seguente autorizzazione IAM per la risorsa parent:

  • speech.customClasses.create

Per saperne di più, consulta la documentazione di IAM.

CreatePhraseSet

rpc CreatePhraseSet(CreatePhraseSetRequest) returns (Operation)

Crea un PhraseSet.

Ambiti di autorizzazione

Richiede il seguente ambito OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Per ulteriori informazioni, consulta Authentication Overview.

Autorizzazioni IAM

Richiede la seguente autorizzazione IAM per la risorsa parent:

  • speech.phraseSets.create

Per saperne di più, consulta la documentazione di IAM.

CreateRecognizer

rpc CreateRecognizer(CreateRecognizerRequest) returns (Operation)

Crea un Recognizer.

Ambiti di autorizzazione

Richiede il seguente ambito OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Per ulteriori informazioni, consulta Authentication Overview.

Autorizzazioni IAM

Richiede la seguente autorizzazione IAM per la risorsa parent:

  • speech.recognizers.create

Per saperne di più, consulta la documentazione di IAM.

DeleteCustomClass

rpc DeleteCustomClass(DeleteCustomClassRequest) returns (Operation)

Elimina CustomClass.

Ambiti di autorizzazione

Richiede il seguente ambito OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Per ulteriori informazioni, consulta Authentication Overview.

Autorizzazioni IAM

Richiede la seguente autorizzazione IAM per la risorsa name:

  • speech.customClasses.delete

Per saperne di più, consulta la documentazione di IAM.

DeletePhraseSet

rpc DeletePhraseSet(DeletePhraseSetRequest) returns (Operation)

Elimina PhraseSet.

Ambiti di autorizzazione

Richiede il seguente ambito OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Per ulteriori informazioni, consulta Authentication Overview.

Autorizzazioni IAM

Richiede la seguente autorizzazione IAM per la risorsa name:

  • speech.phraseSets.delete

Per saperne di più, consulta la documentazione di IAM.

DeleteRecognizer

rpc DeleteRecognizer(DeleteRecognizerRequest) returns (Operation)

Elimina Recognizer.

Ambiti di autorizzazione

Richiede il seguente ambito OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Per ulteriori informazioni, consulta Authentication Overview.

Autorizzazioni IAM

Richiede la seguente autorizzazione IAM per la risorsa name:

  • speech.recognizers.delete

Per saperne di più, consulta la documentazione di IAM.

GetConfig

rpc GetConfig(GetConfigRequest) returns (Config)

Restituisce il Config richiesto.

Ambiti di autorizzazione

Richiede il seguente ambito OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Per ulteriori informazioni, consulta Authentication Overview.

Autorizzazioni IAM

Richiede la seguente autorizzazione IAM per la risorsa name:

  • speech.config.get

Per saperne di più, consulta la documentazione di IAM.

GetCustomClass

rpc GetCustomClass(GetCustomClassRequest) returns (CustomClass)

Restituisce il CustomClass richiesto.

Ambiti di autorizzazione

Richiede il seguente ambito OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Per ulteriori informazioni, consulta Authentication Overview.

Autorizzazioni IAM

Richiede la seguente autorizzazione IAM per la risorsa name:

  • speech.customClasses.get

Per saperne di più, consulta la documentazione di IAM.

GetPhraseSet

rpc GetPhraseSet(GetPhraseSetRequest) returns (PhraseSet)

Restituisce il PhraseSet richiesto.

Ambiti di autorizzazione

Richiede il seguente ambito OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Per ulteriori informazioni, consulta Authentication Overview.

Autorizzazioni IAM

Richiede la seguente autorizzazione IAM per la risorsa name:

  • speech.phraseSets.get

Per saperne di più, consulta la documentazione di IAM.

GetRecognizer

rpc GetRecognizer(GetRecognizerRequest) returns (Recognizer)

Restituisce il Recognizer richiesto. Non riesce con NOT_FOUND se il riconoscitore richiesto non esiste.

Ambiti di autorizzazione

Richiede il seguente ambito OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Per ulteriori informazioni, consulta Authentication Overview.

Autorizzazioni IAM

Richiede la seguente autorizzazione IAM per la risorsa name:

  • speech.recognizers.get

Per saperne di più, consulta la documentazione di IAM.

ListCustomClasses

rpc ListCustomClasses(ListCustomClassesRequest) returns (ListCustomClassesResponse)

Elenca CustomClasses.

Ambiti di autorizzazione

Richiede il seguente ambito OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Per ulteriori informazioni, consulta Authentication Overview.

Autorizzazioni IAM

Richiede la seguente autorizzazione IAM per la risorsa parent:

  • speech.customClasses.list

Per saperne di più, consulta la documentazione di IAM.

ListPhraseSets

rpc ListPhraseSets(ListPhraseSetsRequest) returns (ListPhraseSetsResponse)

Elenca i PhraseSet.

Ambiti di autorizzazione

Richiede il seguente ambito OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Per ulteriori informazioni, consulta Authentication Overview.

Autorizzazioni IAM

Richiede la seguente autorizzazione IAM per la risorsa parent:

  • speech.phraseSets.list

Per saperne di più, consulta la documentazione di IAM.

ListRecognizers

rpc ListRecognizers(ListRecognizersRequest) returns (ListRecognizersResponse)

Elenca i riconoscimenti.

Ambiti di autorizzazione

Richiede il seguente ambito OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Per ulteriori informazioni, consulta Authentication Overview.

Autorizzazioni IAM

Richiede la seguente autorizzazione IAM per la risorsa parent:

  • speech.recognizers.list

Per saperne di più, consulta la documentazione di IAM.

Riconoscimento

rpc Recognize(RecognizeRequest) returns (RecognizeResponse)

Esegue il riconoscimento vocale sincrono: ricevi i risultati dopo che tutto l'audio è stato inviato ed elaborato.

Ambiti di autorizzazione

Richiede il seguente ambito OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Per ulteriori informazioni, consulta Authentication Overview.

Autorizzazioni IAM

Richiede la seguente autorizzazione IAM per la risorsa recognizer:

  • speech.recognizers.recognize

Per saperne di più, consulta la documentazione di IAM.

StreamingRecognize

rpc StreamingRecognize(StreamingRecognizeRequest) returns (StreamingRecognizeResponse)

Esegue il riconoscimento vocale di audio in streaming bidirezionale: ricevi i risultati mentre invii l'audio. Questo metodo è disponibile solo tramite l'API gRPC (non REST).

Ambiti di autorizzazione

Richiede il seguente ambito OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Per ulteriori informazioni, consulta Authentication Overview.

Autorizzazioni IAM

Richiede la seguente autorizzazione IAM per la risorsa recognizer:

  • speech.recognizers.recognize

Per saperne di più, consulta la documentazione di IAM.

UndeleteCustomClass

rpc UndeleteCustomClass(UndeleteCustomClassRequest) returns (Operation)

Annulla l'eliminazione di CustomClass.

Ambiti di autorizzazione

Richiede il seguente ambito OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Per ulteriori informazioni, consulta Authentication Overview.

Autorizzazioni IAM

Richiede la seguente autorizzazione IAM per la risorsa name:

  • speech.customClasses.undelete

Per saperne di più, consulta la documentazione di IAM.

UndeletePhraseSet

rpc UndeletePhraseSet(UndeletePhraseSetRequest) returns (Operation)

Annulla l'eliminazione di PhraseSet.

Ambiti di autorizzazione

Richiede il seguente ambito OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Per ulteriori informazioni, consulta Authentication Overview.

Autorizzazioni IAM

Richiede la seguente autorizzazione IAM per la risorsa name:

  • speech.phraseSets.undelete

Per saperne di più, consulta la documentazione di IAM.

UndeleteRecognizer

rpc UndeleteRecognizer(UndeleteRecognizerRequest) returns (Operation)

Annulla l'eliminazione di Recognizer.

Ambiti di autorizzazione

Richiede il seguente ambito OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Per ulteriori informazioni, consulta Authentication Overview.

Autorizzazioni IAM

Richiede la seguente autorizzazione IAM per la risorsa name:

  • speech.recognizers.undelete

Per saperne di più, consulta la documentazione di IAM.

UpdateConfig

rpc UpdateConfig(UpdateConfigRequest) returns (Config)

Aggiorna Config.

Ambiti di autorizzazione

Richiede il seguente ambito OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Per ulteriori informazioni, consulta Authentication Overview.

Autorizzazioni IAM

Richiede la seguente autorizzazione IAM per la risorsa name:

  • speech.config.update

Per saperne di più, consulta la documentazione di IAM.

UpdateCustomClass

rpc UpdateCustomClass(UpdateCustomClassRequest) returns (Operation)

Aggiorna CustomClass.

Ambiti di autorizzazione

Richiede il seguente ambito OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Per ulteriori informazioni, consulta Authentication Overview.

Autorizzazioni IAM

Richiede la seguente autorizzazione IAM per la risorsa name:

  • speech.customClasses.update

Per saperne di più, consulta la documentazione di IAM.

UpdatePhraseSet

rpc UpdatePhraseSet(UpdatePhraseSetRequest) returns (Operation)

Aggiorna PhraseSet.

Ambiti di autorizzazione

Richiede il seguente ambito OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Per ulteriori informazioni, consulta Authentication Overview.

Autorizzazioni IAM

Richiede la seguente autorizzazione IAM per la risorsa name:

  • speech.phraseSets.update

Per saperne di più, consulta la documentazione di IAM.

UpdateRecognizer

rpc UpdateRecognizer(UpdateRecognizerRequest) returns (Operation)

Aggiorna Recognizer.

Ambiti di autorizzazione

Richiede il seguente ambito OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Per ulteriori informazioni, consulta Authentication Overview.

Autorizzazioni IAM

Richiede la seguente autorizzazione IAM per la risorsa name:

  • speech.recognizers.update

Per saperne di più, consulta la documentazione di IAM.

AccessMetadata

I metadati di accesso per una determinata regione. Può essere applicato se la policy dell'organizzazione per il progetto specificato non consente una determinata regione.

Campi
constraint_type

ConstraintType

Descrive i diversi tipi di vincoli applicati.

ConstraintType

Descrive i diversi tipi di vincoli che possono essere applicati a una regione.

Enum
CONSTRAINT_TYPE_UNSPECIFIED Vincolo non specificato applicato.
RESOURCE_LOCATIONS_ORG_POLICY_CREATE_CONSTRAINT Il criterio dell'organizzazione del progetto non consente la regione specificata.

AutoDetectDecodingConfig

Questo tipo non contiene campi.

Parametri di decodifica rilevati automaticamente. Supportato per le seguenti codifiche:

  • WAV_LINEAR16: campioni PCM little-endian con segno a 16 bit in un contenitore WAV.

  • WAV_MULAW: campioni mulaw compressi a 8 bit in un container WAV.

  • WAV_ALAW: campioni alaw compressi a 8 bit in un container WAV.

  • RFC4867_5_AMR: frame AMR con un'intestazione rfc4867.5.

  • RFC4867_5_AMRWB: frame AMR-WB con un'intestazione rfc4867.5.

  • FLAC: frame FLAC nel formato contenitore "FLAC nativo".

  • MP3: frame audio MPEG con metadati ID3 facoltativi (ignorati).

  • OGG_OPUS: frame audio Opus in un container Ogg.

  • WEBM_OPUS: frame audio Opus in un container WebM.

  • MP4_AAC: frame audio AAC in un container MP4.

  • M4A_AAC: frame audio AAC in un container M4A.

  • MOV_AAC: frame audio AAC in un container MOV.

BatchRecognizeFileMetadata

Metadati di un singolo file in un batch per BatchRecognize.

Campi
config

RecognitionConfig

Funzionalità e metadati audio da utilizzare per il riconoscimento vocale automatico. Questo campo, in combinazione con il campo config_mask, può essere utilizzato per ignorare parti di default_recognition_config della risorsa Recognizer, nonché config a livello di richiesta.

config_mask

FieldMask

L'elenco dei campi in config che sostituiscono i valori in default_recognition_config del riconoscitore durante questa richiesta di riconoscimento. Se non viene fornita alcuna maschera, tutti i campi con valori non predefiniti in config sostituiscono i valori nel riconoscitore per questa richiesta di riconoscimento. Se viene fornita una maschera, solo i campi elencati nella maschera sostituiscono la configurazione nel riconoscitore per questa richiesta di riconoscimento. Se viene fornito un carattere jolly (*), config esegue l'override e sostituisce completamente la configurazione nel riconoscitore per questa richiesta di riconoscimento.

Campo unione audio_source. L'origine audio, ovvero un URI Google Cloud Storage. audio_source può essere solo uno dei seguenti:
uri

string

URI Cloud Storage per il file audio.

BatchRecognizeFileResult

Risultati finali per un singolo file.

Campi
error

Status

Errore, se si è verificato.

metadata

RecognitionResponseMetadata

uri
(deprecated)

string

Deprecato. Utilizza invece cloud_storage_result.native_format_uri.

transcript
(deprecated)

BatchRecognizeResults

Deprecato. Utilizza invece inline_result.transcript.

Campo unione result.

result può essere solo uno dei seguenti:

cloud_storage_result

CloudStorageResult

Risultati del riconoscimento scritti in Cloud Storage. Questo campo viene compilato solo quando GcsOutputConfig è impostato in [RecognitionOutputConfig][google.cloud.speech.v2.RecognitionOutputConfig.

inline_result

InlineResult

Risultati del riconoscimento. Questo campo viene compilato solo quando InlineOutputConfig è impostato in [RecognitionOutputConfig][google.cloud.speech.v2.RecognitionOutputConfig.

BatchRecognizeMetadata

Metadati dell'operazione per BatchRecognize.

Campi
transcription_metadata

map<string, BatchRecognizeTranscriptionMetadata>

Mappa dal nome file fornito ai metadati della trascrizione per quel file.

BatchRecognizeRequest

Messaggio di richiesta per il metodo BatchRecognize.

Campi
recognizer

string

Obbligatorio. Il nome del riconoscitore da utilizzare durante il riconoscimento. Il formato previsto è projects/{project}/locations/{location}/recognizers/{recognizer}. Il segmento {recognizer} può essere impostato su _ per utilizzare un riconoscitore implicito vuoto.

config

RecognitionConfig

Funzionalità e metadati audio da utilizzare per il riconoscimento vocale automatico. Questo campo, in combinazione con il campo config_mask, può essere utilizzato per ignorare parti del default_recognition_config della risorsa Recognizer.

config_mask

FieldMask

L'elenco dei campi in config che sostituiscono i valori in default_recognition_config del riconoscitore durante questa richiesta di riconoscimento. Se non viene fornita alcuna maschera, tutti i campi specificati in config sostituiscono i valori nel riconoscitore per questa richiesta di riconoscimento. Se viene fornita una maschera, solo i campi elencati nella maschera sostituiscono la configurazione nel riconoscitore per questa richiesta di riconoscimento. Se viene fornito un carattere jolly (*), config esegue l'override e sostituisce completamente la configurazione nel riconoscitore per questa richiesta di riconoscimento.

files[]

BatchRecognizeFileMetadata

File audio con metadati per il riconoscimento vocale automatico. Il numero massimo di file che possono essere specificati è 15.

recognition_output_config

RecognitionOutputConfig

Opzioni di configurazione per la posizione in cui generare le trascrizioni di ogni file.

processing_strategy

ProcessingStrategy

Strategia di elaborazione da utilizzare per questa richiesta.

ProcessingStrategy

Possibili strategie di elaborazione per le richieste batch.

Enum
PROCESSING_STRATEGY_UNSPECIFIED Valore predefinito per la strategia di elaborazione. La richiesta viene elaborata non appena viene ricevuta.
DYNAMIC_BATCHING Se selezionata, elabora la richiesta durante i periodi di utilizzo inferiore per uno sconto sul prezzo. La richiesta viene soddisfatta entro 24 ore.

BatchRecognizeResponse

Messaggio di risposta per BatchRecognize incluso in un'operazione di lunga durata Operation.

Campi
results

map<string, BatchRecognizeFileResult>

Mappa dal nome file al risultato finale per quel file.

total_billed_duration

Duration

Se disponibili, i secondi di audio fatturati per la richiesta corrispondente.

BatchRecognizeResults

Tipo di output per Cloud Storage delle trascrizioni BatchRecognize. Sebbene questo proto non venga restituito in questa API, le trascrizioni di Cloud Storage saranno questo proto serializzato e devono essere analizzate di conseguenza.

Campi
results[]

SpeechRecognitionResult

Elenco sequenziale dei risultati della trascrizione corrispondenti alle porzioni sequenziali dell'audio.

metadata

RecognitionResponseMetadata

Metadati relativi al riconoscimento.

BatchRecognizeTranscriptionMetadata

Metadati sulla trascrizione per un singolo file (ad esempio, percentuale di avanzamento).

Campi
progress_percent

int32

La percentuale di trascrizione del file finora.

error

Status

Errore, se si è verificato.

uri

string

L'URI Cloud Storage in cui verranno scritti i risultati del riconoscimento.

CloudStorageResult

I risultati finali vengono scritti in Cloud Storage.

Campi
uri

string

L'URI Cloud Storage in cui sono stati scritti i risultati del riconoscimento.

vtt_format_uri

string

L'URI Cloud Storage in cui i risultati del riconoscimento sono stati scritti come sottotitoli codificati in formato VTT. Questo campo viene compilato solo quando viene richiesto l'output VTT.

srt_format_uri

string

L'URI Cloud Storage in cui sono stati scritti i risultati del riconoscimento come sottotitoli codificati in formato SRT. Questo campo viene compilato solo quando viene richiesto l'output SRT.

Configurazione

Messaggio che rappresenta la configurazione dell'API Speech-to-Text. Ciò include una chiave KMS facoltativa con cui verranno criptati i dati in entrata.

Campi
name

string

Solo output. Identificatore. Il nome della risorsa di configurazione. Esiste esattamente una risorsa di configurazione per progetto per località. Il formato previsto è projects/{project}/locations/{location}/config.

kms_key_name

string

Facoltativo. Un nome della chiave KMS facoltativo che, se presente, verrà utilizzato per criptare le risorse Speech-to-Text at-rest. L'aggiornamento di questa chiave non cripta le risorse esistenti che la utilizzano. Solo le nuove risorse verranno criptate utilizzando questa chiave. Il formato previsto è projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

update_time

Timestamp

Solo output. L'ultima volta che questa risorsa è stata modificata.

CreateCustomClassRequest

Messaggio di richiesta per il metodo CreateCustomClass.

Campi
custom_class

CustomClass

Obbligatorio. La CustomClass da creare.

validate_only

bool

Se impostato, convalida la richiesta e visualizza l'anteprima di CustomClass, ma non crearla effettivamente.

custom_class_id

string

L'ID da utilizzare per CustomClass, che diventerà il componente finale del nome risorsa di CustomClass.

Questo valore deve contenere da 4 a 63 caratteri e i caratteri validi sono /[a-z][0-9]-/.

parent

string

Obbligatorio. Il progetto e la località in cui verrà creata questa CustomClass. Il formato previsto è projects/{project}/locations/{location}.

CreatePhraseSetRequest

Messaggio di richiesta per il metodo CreatePhraseSet.

Campi
phrase_set

PhraseSet

Obbligatorio. Il PhraseSet da creare.

validate_only

bool

Se impostato, convalida la richiesta e visualizza l'anteprima di PhraseSet, ma non crearlo effettivamente.

phrase_set_id

string

L'ID da utilizzare per PhraseSet, che diventerà il componente finale del nome della risorsa PhraseSet.

Questo valore deve contenere da 4 a 63 caratteri e i caratteri validi sono /[a-z][0-9]-/.

parent

string

Obbligatorio. Il progetto e la località in cui verrà creato questo PhraseSet. Il formato previsto è projects/{project}/locations/{location}.

CreateRecognizerRequest

Messaggio di richiesta per il metodo CreateRecognizer.

Campi
recognizer

Recognizer

Obbligatorio. Il riconoscimento da creare.

validate_only

bool

Se impostato, convalida la richiesta e visualizza l'anteprima del riconoscitore, ma non crearlo effettivamente.

recognizer_id

string

L'ID da utilizzare per il riconoscitore, che diventerà il componente finale del nome della risorsa del riconoscitore.

Questo valore deve contenere da 4 a 63 caratteri e i caratteri validi sono /[a-z][0-9]-/.

parent

string

Obbligatorio. Il progetto e la località in cui verrà creato questo riconoscitore. Il formato previsto è projects/{project}/locations/{location}.

CustomClass

CustomClass per la distorsione nel riconoscimento vocale. Utilizzato per definire un insieme di parole o frasi che rappresentano un concetto o un tema comune che probabilmente apparirà nel tuo audio, ad esempio un elenco di nomi di navi passeggeri.

Campi
name

string

Solo output. Identificatore. Il nome risorsa di CustomClass. Formato: projects/{project}/locations/{location}/customClasses/{custom_class}.

uid

string

Solo output. Identificatore univoco assegnato dal sistema per CustomClass.

display_name

string

Facoltativo. Nome leggibile e impostabile dall'utente per CustomClass. Deve contenere al massimo 63 caratteri.

items[]

ClassItem

Una raccolta di elementi del corso.

state

State

Solo output. Lo stato del ciclo di vita di CustomClass.

create_time

Timestamp

Solo output. Data/ora creazione.

update_time

Timestamp

Solo output. L'ultima volta che questa risorsa è stata modificata.

delete_time

Timestamp

Solo output. L'ora in cui è stata richiesta l'eliminazione di questa risorsa.

expire_time

Timestamp

Solo output. L'ora in cui verrà eliminata questa risorsa.

annotations

map<string, string>

Facoltativo. Consente agli utenti di memorizzare piccole quantità di dati arbitrari. Sia la chiave che il valore devono contenere al massimo 63 caratteri ciascuno. Al massimo 100 annotazioni.

etag

string

Solo output. Questo checksum viene calcolato dal server in base al valore di altri campi. Questo valore può essere inviato nelle richieste di aggiornamento, ripristino ed eliminazione per garantire che il client disponga di un valore aggiornato prima di procedere.

reconciling

bool

Solo output. Indica se questa CustomClass è in fase di aggiornamento.

kms_key_name

string

Solo output. Il nome della chiave KMS con cui è criptata CustomClass. Il formato previsto è projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

kms_key_version_name

string

Solo output. Il nome della versione della chiave KMS con cui è criptata CustomClass. Il formato previsto è projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}/cryptoKeyVersions/{crypto_key_version}.

ClassItem

Un elemento della classe.

Campi
value

string

Il valore dell'elemento della classe.

Stato

Insieme di stati che definiscono il ciclo di vita di una CustomClass.

Enum
STATE_UNSPECIFIED Stato non specificato. Questo valore viene utilizzato/è utile solo per distinguere i valori non impostati.
ACTIVE Lo stato normale e attivo.
DELETED Questa CustomClass è stata eliminata.

DeleteCustomClassRequest

Messaggio di richiesta per il metodo DeleteCustomClass.

Campi
name

string

Obbligatorio. Il nome di CustomClass da eliminare. Formato: projects/{project}/locations/{location}/customClasses/{custom_class}

validate_only

bool

Se impostato, convalida la richiesta e visualizza l'anteprima di CustomClass eliminato, ma non eliminarlo effettivamente.

allow_missing

bool

Se impostato su true e CustomClass non viene trovato, la richiesta andrà a buon fine e non verrà eseguita alcuna operazione (in questo caso non viene registrata alcuna operazione).

etag

string

Questo checksum viene calcolato dal server in base al valore di altri campi. Questo valore può essere inviato nelle richieste di aggiornamento, ripristino ed eliminazione per garantire che il client disponga di un valore aggiornato prima di procedere.

DeletePhraseSetRequest

Messaggio di richiesta per il metodo DeletePhraseSet.

Campi
name

string

Obbligatorio. Il nome del PhraseSet da eliminare. Formato: projects/{project}/locations/{location}/phraseSets/{phrase_set}

validate_only

bool

Se impostato, convalida la richiesta e visualizza l'anteprima di PhraseSet eliminato, ma non eliminarlo effettivamente.

allow_missing

bool

Se viene impostato su true e PhraseSet non viene trovato, la richiesta andrà a buon fine e non verrà eseguita alcuna operazione (in questo caso non viene registrata alcuna operazione).

etag

string

Questo checksum viene calcolato dal server in base al valore di altri campi. Questo valore può essere inviato nelle richieste di aggiornamento, ripristino ed eliminazione per garantire che il client disponga di un valore aggiornato prima di procedere.

DeleteRecognizerRequest

Messaggio di richiesta per il metodo DeleteRecognizer.

Campi
name

string

Obbligatorio. Il nome del riconoscitore da eliminare. Formato: projects/{project}/locations/{location}/recognizers/{recognizer}

validate_only

bool

Se impostato, convalida la richiesta e visualizza l'anteprima del riconoscitore eliminato, ma non eliminarlo effettivamente.

allow_missing

bool

Se viene impostato su true e il riconoscitore non viene trovato, la richiesta andrà a buon fine e non verrà eseguita alcuna operazione (in questo caso non viene registrata alcuna operazione).

etag

string

Questo checksum viene calcolato dal server in base al valore di altri campi. Questo valore può essere inviato nelle richieste di aggiornamento, ripristino ed eliminazione per garantire che il client disponga di un valore aggiornato prima di procedere.

DenoiserConfig

Configurazione del riduttore del rumore. Potrebbe non essere supportata per tutti i modelli e potrebbe non avere alcun effetto.

Campi
denoise_audio

bool

Riduci il rumore dell'audio prima di inviarlo al modello di trascrizione.

snr_threshold

float

Soglia del rapporto segnale/rumore (SNR) per il denoiser. In questo caso, SNR indica il volume del segnale vocale. L'audio con un SNR inferiore a questa soglia, il che significa che il parlato è troppo basso, non verrà inviato al modello di trascrizione.

Se snr_threshold=0, non verrà applicato alcun filtro.

ExplicitDecodingConfig

Parametri di decodifica specificati in modo esplicito.

Campi
encoding

AudioEncoding

Obbligatorio. Codifica dei dati audio inviati per il riconoscimento.

sample_rate_hertz

int32

Facoltativo. Frequenza di campionamento in hertz dei dati audio inviati per il riconoscimento. I valori validi sono: 8000-48000 e 16000 è il valore ottimale. Per ottenere risultati ottimali, imposta la frequenza di campionamento della sorgente audio su 16000 Hz. Se non è possibile, utilizza la frequenza di campionamento nativa della sorgente audio (anziché il ricampionamento). Tieni presente che questo campo è contrassegnato come FACOLTATIVO per motivi di compatibilità con le versioni precedenti. È (e lo è sempre stato) effettivamente OBBLIGATORIO.

audio_channel_count

int32

Facoltativo. Numero di canali presenti nei dati audio inviati per il riconoscimento. Tieni presente che questo campo è contrassegnato come FACOLTATIVO per motivi di compatibilità con le versioni precedenti. È (e lo è sempre stato) effettivamente OBBLIGATORIO.

Il valore massimo consentito è 8.

AudioEncoding

Codifiche dei dati audio supportate.

Enum
AUDIO_ENCODING_UNSPECIFIED Valore predefinito. Questo valore non viene utilizzato.
LINEAR16 Campioni PCM little-endian firmati a 16 bit senza intestazione.
MULAW Campioni mulaw compressi a 8 bit senza intestazione.
ALAW Campioni alaw compressi a 8 bit senza intestazione.
AMR Frame AMR con un'intestazione rfc4867.5.
AMR_WB Frame AMR-WB con un'intestazione rfc4867.5.
FLAC Frame FLAC nel formato contenitore "FLAC nativo".
MP3 Frame audio MPEG con metadati ID3 facoltativi (ignorati).
OGG_OPUS Frame audio Opus in un container Ogg.
WEBM_OPUS Frame audio Opus in un container WebM.
MP4_AAC Frame audio AAC in un container MP4.
M4A_AAC Frame audio AAC in un container M4A.
MOV_AAC Frame audio AAC in un container MOV.

GcsOutputConfig

Configurazioni di output per Cloud Storage.

Campi
uri

string

Il prefisso URI Cloud Storage con cui verranno scritti i risultati del riconoscimento.

GetConfigRequest

Messaggio di richiesta per il metodo GetConfig.

Campi
name

string

Obbligatorio. Il nome della configurazione da recuperare. Esiste esattamente una risorsa di configurazione per progetto per località. Il formato previsto è projects/{project}/locations/{location}/config.

GetCustomClassRequest

Messaggio di richiesta per il metodo GetCustomClass.

Campi
name

string

Obbligatorio. Il nome di CustomClass da recuperare. Il formato previsto è projects/{project}/locations/{location}/customClasses/{custom_class}.

GetPhraseSetRequest

Messaggio di richiesta per il metodo GetPhraseSet.

Campi
name

string

Obbligatorio. Il nome del PhraseSet da recuperare. Il formato previsto è projects/{project}/locations/{location}/phraseSets/{phrase_set}.

GetRecognizerRequest

Messaggio di richiesta per il metodo GetRecognizer.

Campi
name

string

Obbligatorio. Il nome del riconoscitore da recuperare. Il formato previsto è projects/{project}/locations/{location}/recognizers/{recognizer}.

InlineOutputConfig

Questo tipo non contiene campi.

Configurazioni di output per la risposta in linea.

InlineResult

I risultati finali vengono restituiti in linea nella risposta di riconoscimento.

Campi
transcript

BatchRecognizeResults

La trascrizione del file audio.

vtt_captions

string

La trascrizione del file audio come sottotitoli codificati in formato VTT. Questo campo viene compilato solo quando viene richiesto l'output VTT.

srt_captions

string

La trascrizione del file audio come sottotitoli codificati in formato SRT. Questo campo viene compilato solo quando viene richiesto l'output SRT.

LanguageMetadata

I metadati relativi alle impostazioni internazionali disponibili in una determinata regione. Al momento, si tratta solo dei modelli disponibili per ogni impostazione regionale

Campi
models

map<string, ModelMetadata>

Mappa delle impostazioni internazionali (codice lingua) -> modelli

ListCustomClassesRequest

Messaggio di richiesta per il metodo ListCustomClasses.

Campi
parent

string

Obbligatorio. Il progetto e la posizione delle risorse CustomClass da elencare. Il formato previsto è projects/{project}/locations/{location}.

page_size

int32

Numero di risultati per richiesta. Un valore valido per page_size è compreso tra 0 e 100 (incluso). Se page_size è zero o non specificato, verrà scelta una dimensione della pagina pari a 5. Se le dimensioni della pagina superano 100, verranno ridotte a 100. Tieni presente che una chiamata potrebbe restituire meno risultati rispetto alle dimensioni della pagina richieste.

page_token

string

Un token di pagina ricevuto da una precedente chiamata ListCustomClasses. Forniscilo per recuperare la pagina successiva.

Durante la paginazione, tutti gli altri parametri forniti a ListCustomClasses devono corrispondere alla chiamata che ha fornito il token di pagina.

show_deleted

bool

Indica se mostrare o meno le risorse eliminate.

ListCustomClassesResponse

Messaggio di risposta per il metodo ListCustomClasses.

Campi
custom_classes[]

CustomClass

L'elenco delle CustomClass richieste.

next_page_token

string

Un token, che può essere inviato come page_token per recuperare la pagina successiva. Se questo campo viene omesso, non verranno visualizzate altre pagine. Questo token scade dopo 72 ore.

ListPhraseSetsRequest

Messaggio di richiesta per il metodo ListPhraseSets.

Campi
parent

string

Obbligatorio. Il progetto e la posizione delle risorse PhraseSet da elencare. Il formato previsto è projects/{project}/locations/{location}.

page_size

int32

Il numero massimo di PhraseSet da restituire. Il servizio potrebbe restituire un numero inferiore a questo valore. Se non specificato, verranno restituiti al massimo 5 PhraseSet. Il valore massimo è 100; i valori superiori a 100 verranno forzati a 100.

page_token

string

Un token di pagina ricevuto da una precedente chiamata ListPhraseSets. Forniscilo per recuperare la pagina successiva.

Durante la paginazione, tutti gli altri parametri forniti a ListPhraseSets devono corrispondere alla chiamata che ha fornito il token di pagina.

show_deleted

bool

Indica se mostrare o meno le risorse eliminate.

ListPhraseSetsResponse

Messaggio di risposta per il metodo ListPhraseSets.

Campi
phrase_sets[]

PhraseSet

L'elenco dei PhraseSet richiesti.

next_page_token

string

Un token, che può essere inviato come page_token per recuperare la pagina successiva. Se questo campo viene omesso, non verranno visualizzate altre pagine. Questo token scade dopo 72 ore.

ListRecognizersRequest

Messaggio di richiesta per il metodo ListRecognizers.

Campi
parent

string

Obbligatorio. Il progetto e la posizione dei riconoscitori da elencare. Il formato previsto è projects/{project}/locations/{location}.

page_size

int32

Il numero massimo di Recognizer da restituire. Il servizio potrebbe restituire un numero inferiore a questo valore. Se non specificato, verranno restituiti al massimo 5 riconoscitori. Il valore massimo è 100; i valori superiori a 100 verranno forzati a 100.

page_token

string

Un token di pagina ricevuto da una precedente chiamata ListRecognizers. Forniscilo per recuperare la pagina successiva.

Durante la paginazione, tutti gli altri parametri forniti a ListRecognizers devono corrispondere alla chiamata che ha fornito il token di pagina.

show_deleted

bool

Indica se mostrare o meno le risorse eliminate.

ListRecognizersResponse

Messaggio di risposta per il metodo ListRecognizers.

Campi
recognizers[]

Recognizer

L'elenco dei Recognizer richiesti.

next_page_token

string

Un token, che può essere inviato come page_token per recuperare la pagina successiva. Se questo campo viene omesso, non verranno visualizzate altre pagine. Questo token scade dopo 72 ore.

LocationsMetadata

Metadati principali per l'API Locations per STT V2. Al momento si tratta solo dei metadati relativi a impostazioni internazionali, modelli e funzionalità

Campi
languages

LanguageMetadata

Informazioni su impostazioni internazionali, modelli e funzionalità disponibili rappresentati nella struttura gerarchica di impostazioni internazionali -> modelli -> funzionalità

access_metadata

AccessMetadata

Informazioni sui metadati di accesso per la regione e il progetto specificati.

ModelFeature

Rappresenta una singola caratteristica di un modello. Se la funzionalità è recognizer, release_state della funzionalità rappresenta release_state del modello

Campi
feature

string

Il nome della funzionalità (nota: la funzionalità può essere recognizer)

release_state

string

Lo stato di rilascio della funzionalità

ModelFeatures

Rappresenta la raccolta di funzionalità appartenenti a un modello

Campi
model_feature[]

ModelFeature

Campo ripetuto che contiene tutte le funzionalità del modello

ModelMetadata

I metadati sui modelli in una determinata regione per una località specifica. Al momento, queste sono solo le funzionalità del modello

Campi
model_features

map<string, ModelFeatures>

Mappa del nome del modello -> funzionalità del modello

NativeOutputFileFormatConfig

Questo tipo non contiene campi.

Configurazioni di output per i proto BatchRecognizeResults serializzati.

OperationMetadata

Rappresenta i metadati di un'operazione a lunga esecuzione.

Campi
create_time

Timestamp

L'ora in cui è stata creata l'operazione.

update_time

Timestamp

Ora dell'ultimo aggiornamento dell'operazione.

resource

string

Il percorso della risorsa per la destinazione dell'operazione.

method

string

Il metodo che ha attivato l'operazione.

kms_key_name

string

Il nome della chiave KMS con cui viene criptato il contenuto dell'operazione. Il formato previsto è projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

kms_key_version_name

string

Il nome della versione della chiave KMS con cui viene criptato il contenuto dell'operazione. Il formato previsto è projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}/cryptoKeyVersions/{crypto_key_version}.

progress_percent

int32

La percentuale di avanzamento dell'operazione. I valori possono variare da 0 a 100. Se il valore è 100, l'operazione è terminata.

Campo unione request. La richiesta che ha generato l'operazione. request può essere solo uno dei seguenti:
batch_recognize_request

BatchRecognizeRequest

BatchRecognizeRequest che ha generato l'operazione.

create_recognizer_request

CreateRecognizerRequest

CreateRecognizerRequest che ha generato l'operazione.

update_recognizer_request

UpdateRecognizerRequest

UpdateRecognizerRequest che ha generato l'operazione.

delete_recognizer_request

DeleteRecognizerRequest

DeleteRecognizerRequest che ha generato l'operazione.

undelete_recognizer_request

UndeleteRecognizerRequest

UndeleteRecognizerRequest che ha generato l'operazione.

create_custom_class_request

CreateCustomClassRequest

CreateCustomClassRequest che ha generato l'operazione.

update_custom_class_request

UpdateCustomClassRequest

UpdateCustomClassRequest che ha generato l'operazione.

delete_custom_class_request

DeleteCustomClassRequest

DeleteCustomClassRequest che ha generato l'operazione.

undelete_custom_class_request

UndeleteCustomClassRequest

L'oggetto UndeleteCustomClassRequest che ha generato l'operazione.

create_phrase_set_request

CreatePhraseSetRequest

CreatePhraseSetRequest che ha generato l'operazione.

update_phrase_set_request

UpdatePhraseSetRequest

UpdatePhraseSetRequest che ha generato l'operazione.

delete_phrase_set_request

DeletePhraseSetRequest

La richiesta DeletePhraseSetRequest che ha generato l'operazione.

undelete_phrase_set_request

UndeletePhraseSetRequest

L'oggetto UndeletePhraseSetRequest che ha generato l'operazione.

update_config_request
(deprecated)

UpdateConfigRequest

UpdateConfigRequest che ha generato l'operazione.

Campo unione metadata. Metadati specifici per RPC. metadata può essere solo uno dei seguenti:
batch_recognize_metadata

BatchRecognizeMetadata

Metadati specifici del metodo BatchRecognize.

OutputFormatConfig

Configurazione del formato dei risultati archiviati in output.

Campi
native

NativeOutputFileFormatConfig

Configurazione per il formato di output nativo. Se questo campo è impostato o se non è impostato nessun altro campo del formato di output, le trascrizioni verranno scritte nel sink nel formato nativo.

vtt

VttOutputFileFormatConfig

Configurazione per il formato di output VTT. Se questo campo è impostato, le trascrizioni verranno scritte nel sink in formato VTT.

srt

SrtOutputFileFormatConfig

Configurazione per il formato di output SRT. Se questo campo è impostato, le trascrizioni verranno scritte nel sink in formato SRT.

PhraseSet

PhraseSet per la distorsione nel riconoscimento vocale. Un PhraseSet viene utilizzato per fornire "suggerimenti" al riconoscimento vocale per privilegiare parole e frasi specifiche nei risultati.

Campi
name

string

Solo output. Identificatore. Il nome della risorsa di PhraseSet. Formato: projects/{project}/locations/{location}/phraseSets/{phrase_set}.

uid

string

Solo output. Identificatore univoco assegnato dal sistema per il PhraseSet.

phrases[]

Phrase

Un elenco di parole e frasi.

boost

float

Suggerimento potenziato. Un valore positivo aumenterà la probabilità che una frase specifica venga riconosciuta rispetto ad altre frasi dal suono simile. Più alto è l'incremento, maggiore è la probabilità di un falso positivo. I valori validi di boost sono compresi tra 0 (escluso) e 20. Ti consigliamo di utilizzare un approccio di ricerca binaria per trovare il valore ottimale per il tuo caso d'uso, nonché di aggiungere frasi con e senza boost alle tue richieste.

display_name

string

Nome leggibile e impostabile dall'utente per il PhraseSet. Deve contenere al massimo 63 caratteri.

state

State

Solo output. Lo stato del ciclo di vita di PhraseSet.

create_time

Timestamp

Solo output. Data/ora creazione.

update_time

Timestamp

Solo output. L'ultima volta che questa risorsa è stata modificata.

delete_time

Timestamp

Solo output. L'ora in cui è stata richiesta l'eliminazione di questa risorsa.

expire_time

Timestamp

Solo output. L'ora in cui verrà eliminata questa risorsa.

annotations

map<string, string>

Consente agli utenti di memorizzare piccole quantità di dati arbitrari. Sia la chiave che il valore devono contenere al massimo 63 caratteri ciascuno. Al massimo 100 annotazioni.

etag

string

Solo output. Questo checksum viene calcolato dal server in base al valore di altri campi. Questo valore può essere inviato nelle richieste di aggiornamento, ripristino ed eliminazione per garantire che il client disponga di un valore aggiornato prima di procedere.

reconciling

bool

Solo output. Indica se questo PhraseSet è in fase di aggiornamento.

kms_key_name

string

Solo output. Il nome della chiave KMS con cui è criptato il PhraseSet. Il formato previsto è projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

kms_key_version_name

string

Solo output. Il nome della versione della chiave KMS con cui è criptato il PhraseSet. Il formato previsto è projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}/cryptoKeyVersions/{crypto_key_version}.

Frase

Una frase contiene parole e "suggerimenti" per le frasi, in modo che il riconoscimento vocale abbia maggiori probabilità di riconoscerle. Può essere utilizzata per migliorare l'accuratezza di parole e frasi specifiche, ad esempio se l'utente pronuncia in genere comandi specifici. Può essere utilizzato anche per aggiungere altre parole al vocabolario del sistema di riconoscimento.

Gli elementi dell'elenco possono includere anche riferimenti CustomClass contenenti gruppi di parole che rappresentano concetti comuni che si verificano nel linguaggio naturale.

Campi
value

string

La frase stessa.

boost

float

Suggerimento potenziato. Sostituisce il boost impostato a livello di set di frasi. Un valore positivo aumenterà la probabilità che una frase specifica venga riconosciuta rispetto ad altre frasi dal suono simile. Più alto è l'incremento, maggiore è la probabilità di un falso positivo. I valori di boosting negativi corrispondono all'anti-bias. L'aggiustamento per ridurre i bias non è attivato, pertanto i valori di incremento negativi restituiranno un errore. I valori boost devono essere compresi tra 0 e 20. Qualsiasi valore al di fuori di questo intervallo restituirà un errore. Ti consigliamo di utilizzare un approccio di ricerca binaria per trovare il valore ottimale per il tuo caso d'uso, nonché di aggiungere frasi con e senza boost alle tue richieste.

Stato

Insieme di stati che definiscono il ciclo di vita di un PhraseSet.

Enum
STATE_UNSPECIFIED Stato non specificato. Questo valore viene utilizzato/è utile solo per distinguere i valori non impostati.
ACTIVE Lo stato normale e attivo.
DELETED Questo PhraseSet è stato eliminato.

RecognitionConfig

Fornisce informazioni al Recognizer che specificano come elaborare la richiesta di riconoscimento.

Campi
model

string

Facoltativo. Quale modello utilizzare per le richieste di riconoscimento. Seleziona il modello più adatto al tuo dominio per ottenere risultati ottimali.

Le indicazioni per la scelta del modello da utilizzare sono disponibili nella documentazione sui modelli di trascrizione, mentre i modelli supportati in ogni regione sono disponibili nella tabella dei modelli supportati.

language_codes[]

string

Facoltativo. La lingua dell'audio fornito come tag lingua BCP-47. I tag di lingua vengono normalizzati in BCP-47 prima di essere utilizzati, ad esempio "en-us" diventa "en-US".

Le lingue supportate per ogni modello sono elencate nella tabella dei modelli supportati.

Se vengono fornite lingue aggiuntive, il risultato del riconoscimento conterrà il riconoscimento nella lingua più probabile rilevata. Il risultato del riconoscimento includerà il tag della lingua rilevata nell'audio.

features

RecognitionFeatures

Funzionalità di riconoscimento vocale da attivare.

adaptation

SpeechAdaptation

Contesto di adattamento vocale che pondera le previsioni del sistema di riconoscimento per parole e frasi specifiche.

transcript_normalization

TranscriptNormalization

Facoltativo. Utilizza la normalizzazione della trascrizione per sostituire automaticamente parti della trascrizione con frasi a tua scelta. Per StreamingRecognize, questa normalizzazione si applica solo alle trascrizioni parziali stabili (stabilità > 0,8) e alle trascrizioni finali.

translation_config

TranslationConfig

Facoltativo. Configurazione facoltativa utilizzata per eseguire automaticamente la traduzione dell'audio specificato nella lingua desiderata per i modelli supportati.

denoiser_config

DenoiserConfig

Facoltativo. (Facoltativo) Configurazione del riduttore del rumore. Potrebbe non essere supportata per tutti i modelli e potrebbe non avere alcun effetto.

Campo unione decoding_config. Parametri di decodifica per l'audio inviato per il riconoscimento. decoding_config può essere solo uno dei seguenti:
auto_decoding_config

AutoDetectDecodingConfig

Rileva automaticamente i parametri di decodifica. Preferito per i formati supportati.

explicit_decoding_config

ExplicitDecodingConfig

Parametri di decodifica specificati in modo esplicito. Obbligatorio se utilizzi l'audio PCM senza intestazione (linear16, mulaw, alaw).

RecognitionFeatures

Funzionalità di riconoscimento disponibili.

Campi
profanity_filter

bool

Se impostato su true, il server tenterà di filtrare le parolacce, sostituendo tutti i caratteri tranne quello iniziale di ogni parola filtrata con degli asterischi, ad esempio "c****". Se impostato su false o omesso, le volgarità non verranno filtrate.

enable_word_time_offsets

bool

Se true, il risultato principale include un elenco di parole e gli offset temporali di inizio e di fine (timestamp) per quelle parole. Se false, non vengono restituite informazioni sull'offset temporale a livello di parola. Il valore predefinito è false.

enable_word_confidence

bool

Se true, il risultato principale include un elenco di parole e la relativa affidabilità. Se false, non vengono restituite informazioni sulla confidenza a livello di parola. Il valore predefinito è false.

enable_automatic_punctuation

bool

Se true, aggiunge la punteggiatura alle ipotesi di risultato del riconoscimento. Questa funzionalità è disponibile solo in alcune lingue. Il valore predefinito di false non aggiunge la punteggiatura alle ipotesi di risultato.

enable_spoken_punctuation

bool

Il comportamento della punteggiatura vocale per la chiamata. Se true, sostituisce la punteggiatura vocale con i simboli corrispondenti nella richiesta. Ad esempio, "come stai punto interrogativo" diventa "come stai?". Per assistenza, visita la pagina https://cloud.google.com/speech-to-text/docs/spoken-punctuation. Se false, la punteggiatura vocale non viene sostituita.

enable_spoken_emojis

bool

Il comportamento delle emoji vocali per la chiamata. Se true, aggiunge la formattazione delle emoji vocali per la richiesta. Le emoji vocali verranno sostituite dai corrispondenti simboli Unicode nella trascrizione finale. Se false, le emoji vocali non vengono sostituite.

multi_channel_mode

MultiChannelMode

Modalità per il riconoscimento dell'audio multicanale.

diarization_config

SpeakerDiarizationConfig

Configurazione per abilitare la diarizzazione degli interlocutori. Per attivare la diarizzazione, imposta questo campo su un messaggio SpeakerDiarizationConfig vuoto.

max_alternatives

int32

Il numero massimo di ipotesi di riconoscimento da restituire. Il server potrebbe restituire meno di max_alternatives. I valori validi sono 0-30. Un valore di 0 o 1 restituirà un massimo di uno. Se omesso, verrà restituito un massimo di uno.

MultiChannelMode

Opzioni per il riconoscimento dell'audio multicanale.

Enum
MULTI_CHANNEL_MODE_UNSPECIFIED Valore predefinito per la modalità multicanale. Se l'audio contiene più canali, verrà trascritto solo il primo, mentre gli altri verranno ignorati.
SEPARATE_RECOGNITION_PER_CHANNEL Se selezionato, ogni canale dell'audio fornito viene trascritto in modo indipendente. Questa opzione non può essere selezionata se il model selezionato è latest_short.

RecognitionOutputConfig

Opzioni di configurazione per l'output o gli output del riconoscimento.

Campi
output_format_config

OutputFormatConfig

Facoltativo. Configurazione del formato dei risultati archiviati in output. Se non specificate, le trascrizioni verranno scritte solo in formato NATIVE.

Campo unione output.

output può essere solo uno dei seguenti:

gcs_output_config

GcsOutputConfig

Se questo messaggio viene compilato, i risultati del riconoscimento vengono scritti nell'URI Google Cloud Storage fornito.

inline_response_config

InlineOutputConfig

Se questo messaggio viene compilato, i risultati del riconoscimento vengono forniti nel messaggio BatchRecognizeResponse dell'operazione al termine. Questa funzionalità è supportata solo quando chiami BatchRecognize con un solo file audio.

RecognitionResponseMetadata

Metadati relativi alla richiesta e alla risposta di riconoscimento.

Campi
request_id

string

Identificatore di richiesta globale generato automaticamente dall'API.

total_billed_duration

Duration

Se disponibili, i secondi di audio fatturati per la richiesta corrispondente.

RecognizeRequest

Messaggio di richiesta per il metodo Recognize. È necessario fornire content o uri. Se fornisci entrambi o nessuno dei due valori, viene restituito INVALID_ARGUMENT. Consulta i limiti dei contenuti.

Campi
recognizer

string

Obbligatorio. Il nome del riconoscitore da utilizzare durante il riconoscimento. Il formato previsto è projects/{project}/locations/{location}/recognizers/{recognizer}. Il segmento {recognizer} può essere impostato su _ per utilizzare un riconoscitore implicito vuoto.

config

RecognitionConfig

Funzionalità e metadati audio da utilizzare per il riconoscimento vocale automatico. Questo campo, in combinazione con il campo config_mask, può essere utilizzato per ignorare parti del default_recognition_config della risorsa Recognizer.

config_mask

FieldMask

L'elenco dei campi in config che sostituiscono i valori in default_recognition_config del riconoscitore durante questa richiesta di riconoscimento. Se non viene fornita alcuna maschera, tutti i campi con valori non predefiniti in config sostituiscono i valori nel riconoscitore per questa richiesta di riconoscimento. Se viene fornita una maschera, solo i campi elencati nella maschera sostituiscono la configurazione nel riconoscitore per questa richiesta di riconoscimento. Se viene fornito un carattere jolly (*), config esegue l'override e sostituisce completamente la configurazione nel riconoscitore per questa richiesta di riconoscimento.

Campo unione audio_source. L'origine audio, che è un contenuto incorporato o un URI Google Cloud Storage. audio_source può essere solo uno dei seguenti:
content

bytes

I byte di dati audio codificati come specificato in RecognitionConfig. Come per tutti i campi di byte, i buffer di protocollo utilizzano una rappresentazione binaria pura, mentre le rappresentazioni JSON utilizzano base64.

uri

string

URI che rimanda a un file contenente i byte di dati audio specificati in RecognitionConfig. Il file non deve essere compresso (ad esempio, gzip). Al momento sono supportati solo gli URI Google Cloud Storage, che devono essere specificati nel seguente formato: gs://bucket_name/object_name (gli altri formati URI restituiscono INVALID_ARGUMENT). Per saperne di più, consulta URI delle richieste.

RecognizeResponse

Messaggio di risposta per il metodo Recognize.

Campi
results[]

SpeechRecognitionResult

Elenco sequenziale dei risultati della trascrizione corrispondenti alle porzioni sequenziali dell'audio.

metadata

RecognitionResponseMetadata

Metadati relativi al riconoscimento.

Riconoscimento

Un messaggio di Riconoscimento. Archivia la configurazione e i metadati del riconoscimento.

Campi
name

string

Solo output. Identificatore. Il nome della risorsa del riconoscitore. Formato: projects/{project}/locations/{location}/recognizers/{recognizer}.

uid

string

Solo output. Identificatore univoco assegnato dal sistema per il riconoscitore.

display_name

string

Nome leggibile e impostabile dall'utente per il riconoscitore. Deve contenere al massimo 63 caratteri.

model
(deprecated)

string

Facoltativo. Questo campo è ora deprecato. Preferisci il campo model nel messaggio RecognitionConfig.

Quale modello utilizzare per le richieste di riconoscimento. Seleziona il modello più adatto al tuo dominio per ottenere risultati ottimali.

Le indicazioni per la scelta del modello da utilizzare sono disponibili nella documentazione sui modelli di trascrizione, mentre i modelli supportati in ogni regione sono disponibili nella tabella dei modelli supportati.

language_codes[]
(deprecated)

string

Facoltativo. Questo campo è ora deprecato. Preferisci il campo language_codes nel messaggio RecognitionConfig.

La lingua dell'audio fornito come tag lingua BCP-47.

Le lingue supportate per ogni modello sono elencate nella tabella dei modelli supportati.

Se vengono fornite lingue aggiuntive, il risultato del riconoscimento conterrà il riconoscimento nella lingua più probabile rilevata. Il risultato del riconoscimento includerà il tag della lingua rilevata nell'audio. Quando crei o aggiorni un riconoscitore, questi valori vengono memorizzati in formato BCP-47 normalizzato. Ad esempio, "en-us" viene memorizzato come "en-US".

default_recognition_config

RecognitionConfig

Configurazione predefinita da utilizzare per le richieste con questo riconoscimento. Questa impostazione può essere sovrascritta dalla configurazione in linea nel campo RecognizeRequest.config.

annotations

map<string, string>

Consente agli utenti di memorizzare piccole quantità di dati arbitrari. Sia la chiave che il valore devono contenere al massimo 63 caratteri ciascuno. Al massimo 100 annotazioni.

state

State

Solo output. Lo stato del ciclo di vita del riconoscitore.

create_time

Timestamp

Solo output. Data/ora creazione.

update_time

Timestamp

Solo output. L'ultima volta che questo riconoscitore è stato modificato.

delete_time

Timestamp

Solo output. L'ora in cui è stata richiesta l'eliminazione di questo riconoscitore.

expire_time

Timestamp

Solo output. L'ora in cui questo riconoscitore verrà eliminato.

etag

string

Solo output. Questo checksum viene calcolato dal server in base al valore di altri campi. Questo valore può essere inviato nelle richieste di aggiornamento, ripristino ed eliminazione per garantire che il client disponga di un valore aggiornato prima di procedere.

reconciling

bool

Solo output. Indica se questo Recognizer è in fase di aggiornamento.

kms_key_name

string

Solo output. Il nome della chiave KMS con cui viene criptato il riconoscitore. Il formato previsto è projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

kms_key_version_name

string

Solo output. Il nome della versione della chiave KMS con cui viene criptato il riconoscitore. Il formato previsto è projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}/cryptoKeyVersions/{crypto_key_version}.

Stato

Insieme di stati che definiscono il ciclo di vita di un riconoscitore.

Enum
STATE_UNSPECIFIED Il valore predefinito. Questo valore viene utilizzato se lo stato viene omesso.
ACTIVE Il Riconoscitore è attivo e pronto per l'uso.
DELETED Questo riconoscitore è stato eliminato.

SpeakerDiarizationConfig

Configurazione per abilitare la diarizzazione degli interlocutori.

Campi
min_speaker_count

int32

Facoltativo. Il sistema determina automaticamente il numero di speaker. Questo valore non è attualmente utilizzato.

max_speaker_count

int32

Facoltativo. Il sistema determina automaticamente il numero di speaker. Questo valore non è attualmente utilizzato.

SpeechAdaptation

Fornisce al riconoscimento vocale "suggerimenti" che privilegiano parole e frasi specifiche nei risultati. PhraseSets può essere specificato come risorsa incorporata o come riferimento a una risorsa PhraseSet esistente.

Campi
phrase_sets[]

AdaptationPhraseSet

Un elenco di PhraseSet incorporati o a cui viene fatto riferimento.

custom_classes[]

CustomClass

Un elenco di CustomClass inline. È possibile fare riferimento direttamente alle risorse CustomClass esistenti in un PhraseSet.

AdaptationPhraseSet

Un PhraseSet di distorsione, che può essere una stringa che fa riferimento al nome di una risorsa PhraseSets esistente o una definizione incorporata di un PhraseSet.

Campi

Campo unione value.

value può essere solo uno dei seguenti:

phrase_set

string

Il nome di una risorsa PhraseSet esistente. L'utente deve disporre dell'accesso in lettura alla risorsa e questa non deve essere eliminata.

inline_phrase_set

PhraseSet

Un PhraseSet definito in linea.

SpeechRecognitionAlternative

Ipotesi alternative (ovvero elenco n-best).

Campi
transcript

string

Testo della trascrizione che rappresenta le parole pronunciate dall'utente.

confidence

float

La stima di confidenza compresa tra 0,0 e 1,0. Un numero più alto indica una maggiore probabilità stimata che le parole riconosciute siano corrette. Questo campo è impostato solo per l'alternativa principale di un risultato non in streaming o di un risultato in streaming in cui is_final è impostato su true. Non è garantita l'accuratezza di questo campo e gli utenti non devono fare affidamento sulla sua disponibilità. Il valore predefinito 0.0 è un valore sentinella che indica che confidence non è stato impostato.

words[]

WordInfo

Un elenco di informazioni specifiche per ogni parola riconosciuta. Quando SpeakerDiarizationConfig è impostato, vedrai tutte le parole dall'inizio dell'audio.

SpeechRecognitionResult

Un risultato del riconoscimento vocale corrispondente a una parte dell'audio.

Campi
alternatives[]

SpeechRecognitionAlternative

Può contenere una o più ipotesi di riconoscimento. Queste alternative sono ordinate in termini di precisione, con l'alternativa in alto (la prima) che è la più probabile, in base alla classificazione del sistema di riconoscimento.

channel_tag

int32

Per l'audio multicanale, questo è il numero del canale corrispondente al risultato riconosciuto per l'audio di quel canale. Per audio_channel_count = N, i valori di output possono variare da 1 a N.

result_end_offset

Duration

Offset temporale della fine di questo risultato rispetto all'inizio dell'audio.

language_code

string

Solo output. Il tag lingua BCP-47 della lingua in questo risultato. È stato rilevato che questo codice di lingua è quello con la maggiore probabilità di essere parlato nell'audio.

SrtOutputFileFormatConfig

Questo tipo non contiene campi.

File di sottotitoli formattato SubRip Text.

StreamingRecognitionConfig

Fornisce informazioni di configurazione per la richiesta StreamingRecognize.

Campi
config

RecognitionConfig

Obbligatorio. Funzionalità e metadati audio da utilizzare per il riconoscimento vocale automatico. Questo campo, in combinazione con il campo config_mask, può essere utilizzato per ignorare parti del default_recognition_config della risorsa Recognizer.

config_mask

FieldMask

L'elenco dei campi in config che sostituiscono i valori in default_recognition_config del riconoscitore durante questa richiesta di riconoscimento. Se non viene fornita alcuna maschera, tutti i campi con valori non predefiniti in config sostituiscono i valori in Recognizer per questa richiesta di riconoscimento. Se viene fornita una maschera, solo i campi elencati nella maschera sostituiscono la configurazione nel riconoscitore per questa richiesta di riconoscimento. Se viene fornito un carattere jolly (*), config esegue l'override e sostituisce completamente la configurazione nel riconoscitore per questa richiesta di riconoscimento.

streaming_features

StreamingRecognitionFeatures

Funzionalità di riconoscimento vocale da abilitare per richieste specifiche di riconoscimento audio in streaming.

StreamingRecognitionFeatures

Funzionalità di riconoscimento disponibili specifiche per le richieste di riconoscimento dello streaming.

Campi
enable_voice_activity_events

bool

Se true, le risposte con eventi vocali verranno restituite man mano che vengono rilevate.

interim_results

bool

Se trasmettere o meno i risultati provvisori al cliente. Se impostato su true, i risultati provvisori verranno trasmessi in streaming al client. In caso contrario, verrà restituita solo la risposta finale.

voice_activity_timeout

VoiceActivityTimeout

Se impostato, il server chiuderà automaticamente lo stream dopo che è trascorsa la durata specificata dall'invio dell'ultimo evento vocale VOICE_ACTIVITY. Anche il campo voice_activity_events deve essere impostato su true.

VoiceActivityTimeout

Eventi per i quali è possibile impostare un timeout per l'attività vocale.

Campi
speech_start_timeout

Duration

Durata del timeout dello stream se non inizia alcun discorso. Se questo valore è impostato e non viene rilevato alcun discorso in questo periodo di tempo all'inizio dello stream, il server chiuderà lo stream.

speech_end_timeout

Duration

Durata del timeout dello stream dopo la fine del discorso. Se questo valore è impostato e non viene rilevato alcun discorso in questo periodo di tempo dopo che è stato rilevato un discorso, il server chiuderà lo stream.

StreamingRecognitionResult

Un risultato del riconoscimento vocale di audio in streaming corrispondente a una parte dell'audio in fase di elaborazione.

Campi
alternatives[]

SpeechRecognitionAlternative

Può contenere una o più ipotesi di riconoscimento. Queste alternative sono ordinate in termini di precisione, con l'alternativa in alto (la prima) che è la più probabile, in base alla classificazione del sistema di riconoscimento.

is_final

bool

Se false, questo StreamingRecognitionResult rappresenta un risultato provvisorio che potrebbe cambiare. Se true, questa è l'ultima volta che il servizio vocale restituirà questo particolare StreamingRecognitionResult, il sistema di riconoscimento non restituirà ulteriori ipotesi per questa parte della trascrizione e dell'audio corrispondente.

stability

float

Una stima della probabilità che il sistema di riconoscimento non modifichi la sua ipotesi su questo risultato intermedio. I valori vanno da 0,0 (completamente instabile) a 1,0 (completamente stabile). Questo campo viene fornito solo per i risultati provvisori (is_final=false). Il valore predefinito 0.0 è un valore sentinella che indica che stability non è stato impostato.

result_end_offset

Duration

Offset temporale della fine di questo risultato rispetto all'inizio dell'audio.

channel_tag

int32

Per l'audio multicanale, questo è il numero del canale corrispondente al risultato riconosciuto per l'audio di quel canale. Per audio_channel_count = N, i valori di output possono variare da 1 a N.

language_code

string

Solo output. Il tag lingua BCP-47 della lingua in questo risultato. È stato rilevato che questo codice di lingua è quello con la maggiore probabilità di essere parlato nell'audio.

StreamingRecognizeRequest

Messaggio di richiesta per il metodo StreamingRecognize. Più messaggi StreamingRecognizeRequest vengono inviati in una sola chiamata.

Se Recognizer a cui fa riferimento recognizer contiene una configurazione della richiesta completamente specificata, lo stream può contenere solo messaggi con audio impostato.

In caso contrario, il primo messaggio deve contenere un messaggio recognizer e un messaggio streaming_config che insieme specificano completamente la configurazione della richiesta e non devono contenere audio. Tutti i messaggi successivi devono avere impostato solo audio.

Campi
recognizer

string

Obbligatorio. Il nome del riconoscitore da utilizzare durante il riconoscimento. Il formato previsto è projects/{project}/locations/{location}/recognizers/{recognizer}. Il segmento {recognizer} può essere impostato su _ per utilizzare un riconoscitore implicito vuoto.

Campo unione streaming_request.

streaming_request può essere solo uno dei seguenti:

streaming_config

StreamingRecognitionConfig

StreamingRecognitionConfig da utilizzare in questo tentativo di riconoscimento. Se fornita, sostituirà la RecognitionConfig predefinita archiviata nel riconoscitore.

audio

bytes

Byte audio incorporati da riconoscere. La dimensione massima per questo campo è 15 kB per richiesta.

StreamingRecognizeResponse

StreamingRecognizeResponse è l'unico messaggio restituito al client da StreamingRecognize. Una serie di zero o più messaggi StreamingRecognizeResponse vengono trasmessi in streaming al client. Se non è presente audio riconoscibile, nessun messaggio viene trasmesso in streaming al client.

Ecco alcuni esempi di StreamingRecognizeResponse che potrebbero essere restituiti durante l'elaborazione dell'audio:

  1. results { alternatives { transcript: "tubo" } stability: 0.01 }

  2. results { alternatives { transcript: "to be a" } stability: 0.01 }

  3. results { alternatives { transcript: "to be" } stability: 0.9 } results { alternatives { transcript: " or not to be" } stability: 0.01 }

  4. results { alternatives { transcript: "to be or not to be" confidence: 0.92 } alternatives { transcript: "to bee or not to bee" } is_final: true }

  5. results { alternatives { transcript: " that's" } stability: 0.01 }

  6. results { alternatives { transcript: " that is" } stability: 0.9 } results { alternatives { transcript: " the question" } stability: 0.01 }

  7. results { alternatives { transcript: " that is the question" confidence: 0.98 } alternatives { transcript: " that was the question" } is_final: true }

Note:

  • Solo due delle risposte precedenti, la 4 e la 7, contengono i risultati finali, indicati da is_final: true. La concatenazione di questi elementi genera la trascrizione completa: "Essere o non essere, questo è il problema".

  • Gli altri contengono results provvisori. I numeri 3 e 6 contengono due results provvisori: la prima parte ha un'elevata stabilità ed è meno probabile che cambi; la seconda parte ha una bassa stabilità ed è molto probabile che cambi. Un UI designer potrebbe scegliere di mostrare solo results con stabilità elevata.

  • I valori specifici di stability e confidence mostrati sopra sono solo a scopo illustrativo. I valori effettivi possono variare.

  • In ogni risposta, verrà impostato solo uno di questi campi: error, speech_event_type o uno o più campi results (ripetuti).

Campi
results[]

StreamingRecognitionResult

Questo elenco ripetuto contiene zero o più risultati che corrispondono a porzioni consecutive dell'audio attualmente in elaborazione. Contiene zero o un risultato is_final=true (la parte appena risolta), seguito da zero o più risultati is_final=false (i risultati provvisori).

speech_event_type

SpeechEventType

Indica il tipo di evento vocale.

speech_event_offset

Duration

Offset temporale tra l'inizio dell'audio e l'emissione dell'evento.

metadata

RecognitionResponseMetadata

Metadati relativi al riconoscimento.

SpeechEventType

Indica il tipo di evento vocale.

Enum
SPEECH_EVENT_TYPE_UNSPECIFIED Nessun evento vocale specificato.
END_OF_SINGLE_UTTERANCE Questo evento indica che il server ha rilevato la fine dell'espressione vocale dell'utente e non prevede ulteriori input vocali. Pertanto, il server non elaborerà audio aggiuntivo e chiuderà lo stream bidirezionale gRPC. Questo evento viene inviato solo se si è verificato un taglio forzato a causa del rilevamento anticipato del silenzio. Questo evento è disponibile solo tramite latest_short model.
SPEECH_ACTIVITY_BEGIN Questo evento indica che il server ha rilevato l'inizio dell'attività vocale umana nel flusso. Questo evento può essere restituito più volte se il parlato inizia e si interrompe ripetutamente durante lo stream. Questo evento viene inviato solo se voice_activity_events è impostato su true.
SPEECH_ACTIVITY_END Questo evento indica che il server ha rilevato la fine dell'attività vocale umana nello stream. Questo evento può essere restituito più volte se il parlato inizia e si interrompe ripetutamente durante lo stream. Questo evento viene inviato solo se voice_activity_events è impostato su true.

TranscriptNormalization

Configurazione della normalizzazione della trascrizione. Utilizza la normalizzazione della trascrizione per sostituire automaticamente parti della trascrizione con frasi a tua scelta. Per StreamingRecognize, questa normalizzazione si applica solo alle trascrizioni parziali stabili (stabilità > 0,8) e alle trascrizioni finali.

Campi
entries[]

Entry

Un elenco di voci di sostituzione. Eseguiremo la sostituzione con una voce alla volta. Ad esempio, la seconda voce di ["cat" => "dog", "mountain cat" => "mountain dog"] non verrà mai applicata perché elaboreremo sempre la prima voce prima. Al massimo 100 voci.

Voce

Una singola configurazione di sostituzione.

Campi
search

string

Cosa sostituire. La lunghezza massima è di 100 caratteri.

replace

string

Con cosa sostituire. La lunghezza massima è di 100 caratteri.

case_sensitive

bool

Indica se la ricerca è sensibile alle maiuscole.

TranslationConfig

Configurazione della traduzione. Utilizzalo per tradurre l'audio fornito in testo nella lingua desiderata.

Campi
target_language

string

Obbligatorio. Il codice della lingua in cui tradurre.

UndeleteCustomClassRequest

Messaggio di richiesta per il metodo UndeleteCustomClass.

Campi
name

string

Obbligatorio. Il nome di CustomClass da ripristinare. Formato: projects/{project}/locations/{location}/customClasses/{custom_class}

validate_only

bool

Se impostato, convalida la richiesta e visualizza l'anteprima di CustomClass eliminata, ma non ripristinarla.

etag

string

Questo checksum viene calcolato dal server in base al valore di altri campi. Questo valore può essere inviato nelle richieste di aggiornamento, ripristino ed eliminazione per garantire che il client disponga di un valore aggiornato prima di procedere.

UndeletePhraseSetRequest

Messaggio di richiesta per il metodo UndeletePhraseSet.

Campi
name

string

Obbligatorio. Il nome del PhraseSet da recuperare. Formato: projects/{project}/locations/{location}/phraseSets/{phrase_set}

validate_only

bool

Se impostato, convalida la richiesta e visualizza l'anteprima del PhraseSet eliminato, ma non ripristinarlo.

etag

string

Questo checksum viene calcolato dal server in base al valore di altri campi. Questo valore può essere inviato nelle richieste di aggiornamento, ripristino ed eliminazione per garantire che il client disponga di un valore aggiornato prima di procedere.

UndeleteRecognizerRequest

Messaggio di richiesta per il metodo UndeleteRecognizer.

Campi
name

string

Obbligatorio. Il nome del Recognizer da recuperare. Formato: projects/{project}/locations/{location}/recognizers/{recognizer}

validate_only

bool

Se impostato, convalida la richiesta e visualizza l'anteprima del riconoscitore eliminato, ma non ripristinarlo.

etag

string

Questo checksum viene calcolato dal server in base al valore di altri campi. Questo valore può essere inviato nelle richieste di aggiornamento, ripristino ed eliminazione per garantire che il client disponga di un valore aggiornato prima di procedere.

UpdateConfigRequest

Messaggio di richiesta per il metodo UpdateConfig.

Campi
config

Config

Obbligatorio. La configurazione da aggiornare.

Il campo name della configurazione viene utilizzato per identificare la configurazione da aggiornare. Il formato previsto è projects/{project}/locations/{location}/config.

update_mask

FieldMask

L'elenco dei campi da aggiornare.

UpdateCustomClassRequest

Messaggio di richiesta per il metodo UpdateCustomClass.

Campi
custom_class

CustomClass

Obbligatorio. CustomClass da aggiornare.

Il campo name di CustomClass viene utilizzato per identificare la CustomClass da aggiornare. Formato: projects/{project}/locations/{location}/customClasses/{custom_class}.

update_mask

FieldMask

L'elenco dei campi da aggiornare. Se è vuoto, vengono presi in considerazione tutti i campi per l'aggiornamento.

validate_only

bool

Se impostato, convalida la richiesta e visualizza l'anteprima di CustomClass aggiornata, ma non aggiornarla effettivamente.

UpdatePhraseSetRequest

Messaggio di richiesta per il metodo UpdatePhraseSet.

Campi
phrase_set

PhraseSet

Obbligatorio. Il PhraseSet da aggiornare.

Il campo name di PhraseSet viene utilizzato per identificare il PhraseSet da aggiornare. Formato: projects/{project}/locations/{location}/phraseSets/{phrase_set}.

update_mask

FieldMask

L'elenco dei campi da aggiornare. Se è vuoto, vengono presi in considerazione per l'aggiornamento tutti i campi con valori non predefiniti. Utilizza * per aggiornare l'intera risorsa PhraseSet.

validate_only

bool

Se impostato, convalida la richiesta e visualizza l'anteprima del PhraseSet aggiornato, ma non aggiornarlo effettivamente.

UpdateRecognizerRequest

Messaggio di richiesta per il metodo UpdateRecognizer.

Campi
recognizer

Recognizer

Obbligatorio. Il riconoscitore da aggiornare.

Il campo name di Recognizer viene utilizzato per identificare il Recognizer da aggiornare. Formato: projects/{project}/locations/{location}/recognizers/{recognizer}.

update_mask

FieldMask

L'elenco dei campi da aggiornare. Se è vuoto, vengono presi in considerazione per l'aggiornamento tutti i campi con valori non predefiniti. Utilizza * per aggiornare l'intera risorsa Recognizer.

validate_only

bool

Se impostato, convalida la richiesta e visualizza l'anteprima del riconoscitore aggiornato, ma non aggiornarlo effettivamente.

VttOutputFileFormatConfig

Questo tipo non contiene campi.

Configurazioni di output per il file dei sottotitoli codificati nel formato WebVTT.

WordInfo

Informazioni specifiche per le parole riconosciute.

Campi
start_offset

Duration

Offset temporale relativo all'inizio dell'audio e corrispondente all'inizio della parola pronunciata. Questo campo viene impostato solo se enable_word_time_offsets è true e solo nell'ipotesi principale. Si tratta di una funzionalità sperimentale e l'accuratezza dell'offset temporale può variare.

end_offset

Duration

Offset temporale relativo all'inizio dell'audio e corrispondente alla fine della parola pronunciata. Questo campo viene impostato solo se enable_word_time_offsets è true e solo nell'ipotesi principale. Si tratta di una funzionalità sperimentale e l'accuratezza dell'offset temporale può variare.

word

string

La parola corrispondente a questo insieme di informazioni.

confidence

float

La stima di confidenza compresa tra 0,0 e 1,0. Un numero più alto indica una maggiore probabilità stimata che le parole riconosciute siano corrette. Questo campo è impostato solo per l'alternativa principale di un risultato non in streaming o di un risultato in streaming in cui is_final è impostato su true. Non è garantita l'accuratezza di questo campo e gli utenti non devono fare affidamento sulla sua disponibilità. Il valore predefinito 0.0 è un valore sentinella che indica che confidence non è stato impostato.

speaker_label

string

A ogni persona che parla nell'audio viene assegnata un'etichetta distinta. Questo campo specifica quale di questi oratori è stato rilevato mentre pronunciava questa parola. speaker_label viene impostato se viene fornito SpeakerDiarizationConfig e solo nell'alternativa principale.