Package google.cloud.speech.v2

Índice

Voz

Ativa a transcrição de voz e a gestão de recursos.

BatchRecognize

rpc BatchRecognize(BatchRecognizeRequest) returns (Operation)

Executa o reconhecimento de voz assíncrono em lote: envia um pedido com N ficheiros de áudio e recebe uma operação de longa duração que pode ser consultada para ver quando as transcrições estão concluídas.

Âmbitos de autorização

Requer o seguinte âmbito do OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para mais informações, consulte o Authentication Overview.

Autorizações de IAM

Requer a seguinte autorização de IAM no recurso recognizer:

  • speech.recognizers.recognize

Para mais informações, consulte a documentação do IAM.

CreateCustomClass

rpc CreateCustomClass(CreateCustomClassRequest) returns (Operation)

Cria um CustomClass.

Âmbitos de autorização

Requer o seguinte âmbito do OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para mais informações, consulte o Authentication Overview.

Autorizações de IAM

Requer a seguinte autorização de IAM no recurso parent:

  • speech.customClasses.create

Para mais informações, consulte a documentação do IAM.

CreatePhraseSet

rpc CreatePhraseSet(CreatePhraseSetRequest) returns (Operation)

Cria um PhraseSet.

Âmbitos de autorização

Requer o seguinte âmbito do OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para mais informações, consulte o Authentication Overview.

Autorizações de IAM

Requer a seguinte autorização de IAM no recurso parent:

  • speech.phraseSets.create

Para mais informações, consulte a documentação do IAM.

CreateRecognizer

rpc CreateRecognizer(CreateRecognizerRequest) returns (Operation)

Cria um Recognizer.

Âmbitos de autorização

Requer o seguinte âmbito do OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para mais informações, consulte o Authentication Overview.

Autorizações de IAM

Requer a seguinte autorização de IAM no recurso parent:

  • speech.recognizers.create

Para mais informações, consulte a documentação do IAM.

DeleteCustomClass

rpc DeleteCustomClass(DeleteCustomClassRequest) returns (Operation)

Elimina o CustomClass.

Âmbitos de autorização

Requer o seguinte âmbito do OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para mais informações, consulte o Authentication Overview.

Autorizações de IAM

Requer a seguinte autorização de IAM no recurso name:

  • speech.customClasses.delete

Para mais informações, consulte a documentação do IAM.

DeletePhraseSet

rpc DeletePhraseSet(DeletePhraseSetRequest) returns (Operation)

Elimina o PhraseSet.

Âmbitos de autorização

Requer o seguinte âmbito do OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para mais informações, consulte o Authentication Overview.

Autorizações de IAM

Requer a seguinte autorização de IAM no recurso name:

  • speech.phraseSets.delete

Para mais informações, consulte a documentação do IAM.

DeleteRecognizer

rpc DeleteRecognizer(DeleteRecognizerRequest) returns (Operation)

Elimina o Recognizer.

Âmbitos de autorização

Requer o seguinte âmbito do OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para mais informações, consulte o Authentication Overview.

Autorizações de IAM

Requer a seguinte autorização de IAM no recurso name:

  • speech.recognizers.delete

Para mais informações, consulte a documentação do IAM.

GetConfig

rpc GetConfig(GetConfigRequest) returns (Config)

Devolve o Config pedido.

Âmbitos de autorização

Requer o seguinte âmbito do OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para mais informações, consulte o Authentication Overview.

Autorizações de IAM

Requer a seguinte autorização de IAM no recurso name:

  • speech.config.get

Para mais informações, consulte a documentação do IAM.

GetCustomClass

rpc GetCustomClass(GetCustomClassRequest) returns (CustomClass)

Devolve o CustomClass pedido.

Âmbitos de autorização

Requer o seguinte âmbito do OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para mais informações, consulte o Authentication Overview.

Autorizações de IAM

Requer a seguinte autorização de IAM no recurso name:

  • speech.customClasses.get

Para mais informações, consulte a documentação do IAM.

GetPhraseSet

rpc GetPhraseSet(GetPhraseSetRequest) returns (PhraseSet)

Devolve o PhraseSet pedido.

Âmbitos de autorização

Requer o seguinte âmbito do OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para mais informações, consulte o Authentication Overview.

Autorizações de IAM

Requer a seguinte autorização de IAM no recurso name:

  • speech.phraseSets.get

Para mais informações, consulte a documentação do IAM.

GetRecognizer

rpc GetRecognizer(GetRecognizerRequest) returns (Recognizer)

Devolve o Recognizer pedido. Falha com NOT_FOUND se o Recognizer pedido não existir.

Âmbitos de autorização

Requer o seguinte âmbito do OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para mais informações, consulte o Authentication Overview.

Autorizações de IAM

Requer a seguinte autorização de IAM no recurso name:

  • speech.recognizers.get

Para mais informações, consulte a documentação do IAM.

ListCustomClasses

rpc ListCustomClasses(ListCustomClassesRequest) returns (ListCustomClassesResponse)

Lista as classes personalizadas.

Âmbitos de autorização

Requer o seguinte âmbito do OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para mais informações, consulte o Authentication Overview.

Autorizações de IAM

Requer a seguinte autorização de IAM no recurso parent:

  • speech.customClasses.list

Para mais informações, consulte a documentação do IAM.

ListPhraseSets

rpc ListPhraseSets(ListPhraseSetsRequest) returns (ListPhraseSetsResponse)

Apresenta PhraseSets.

Âmbitos de autorização

Requer o seguinte âmbito do OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para mais informações, consulte o Authentication Overview.

Autorizações de IAM

Requer a seguinte autorização de IAM no recurso parent:

  • speech.phraseSets.list

Para mais informações, consulte a documentação do IAM.

ListRecognizers

rpc ListRecognizers(ListRecognizersRequest) returns (ListRecognizersResponse)

Identificadores de listas.

Âmbitos de autorização

Requer o seguinte âmbito do OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para mais informações, consulte o Authentication Overview.

Autorizações de IAM

Requer a seguinte autorização de IAM no recurso parent:

  • speech.recognizers.list

Para mais informações, consulte a documentação do IAM.

Reconhece

rpc Recognize(RecognizeRequest) returns (RecognizeResponse)

Realiza o reconhecimento de voz síncrono: recebe resultados depois de todo o áudio ter sido enviado e processado.

Âmbitos de autorização

Requer o seguinte âmbito do OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para mais informações, consulte o Authentication Overview.

Autorizações de IAM

Requer a seguinte autorização de IAM no recurso recognizer:

  • speech.recognizers.recognize

Para mais informações, consulte a documentação do IAM.

StreamingRecognize

rpc StreamingRecognize(StreamingRecognizeRequest) returns (StreamingRecognizeResponse)

Realiza o reconhecimento de voz em streaming bidirecional: recebe resultados enquanto envia áudio. Este método só está disponível através da API gRPC (não REST).

Âmbitos de autorização

Requer o seguinte âmbito do OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para mais informações, consulte o Authentication Overview.

Autorizações de IAM

Requer a seguinte autorização de IAM no recurso recognizer:

  • speech.recognizers.recognize

Para mais informações, consulte a documentação do IAM.

UndeleteCustomClass

rpc UndeleteCustomClass(UndeleteCustomClassRequest) returns (Operation)

Anula a eliminação de CustomClass.

Âmbitos de autorização

Requer o seguinte âmbito do OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para mais informações, consulte o Authentication Overview.

Autorizações de IAM

Requer a seguinte autorização de IAM no recurso name:

  • speech.customClasses.undelete

Para mais informações, consulte a documentação do IAM.

UndeletePhraseSet

rpc UndeletePhraseSet(UndeletePhraseSetRequest) returns (Operation)

Anula a eliminação de PhraseSet.

Âmbitos de autorização

Requer o seguinte âmbito do OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para mais informações, consulte o Authentication Overview.

Autorizações de IAM

Requer a seguinte autorização de IAM no recurso name:

  • speech.phraseSets.undelete

Para mais informações, consulte a documentação do IAM.

UndeleteRecognizer

rpc UndeleteRecognizer(UndeleteRecognizerRequest) returns (Operation)

Anula a eliminação de Recognizer.

Âmbitos de autorização

Requer o seguinte âmbito do OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para mais informações, consulte o Authentication Overview.

Autorizações de IAM

Requer a seguinte autorização de IAM no recurso name:

  • speech.recognizers.undelete

Para mais informações, consulte a documentação do IAM.

UpdateConfig

rpc UpdateConfig(UpdateConfigRequest) returns (Config)

Atualiza o Config.

Âmbitos de autorização

Requer o seguinte âmbito do OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para mais informações, consulte o Authentication Overview.

Autorizações de IAM

Requer a seguinte autorização de IAM no recurso name:

  • speech.config.update

Para mais informações, consulte a documentação do IAM.

UpdateCustomClass

rpc UpdateCustomClass(UpdateCustomClassRequest) returns (Operation)

Atualiza o CustomClass.

Âmbitos de autorização

Requer o seguinte âmbito do OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para mais informações, consulte o Authentication Overview.

Autorizações de IAM

Requer a seguinte autorização de IAM no recurso name:

  • speech.customClasses.update

Para mais informações, consulte a documentação do IAM.

UpdatePhraseSet

rpc UpdatePhraseSet(UpdatePhraseSetRequest) returns (Operation)

Atualiza o PhraseSet.

Âmbitos de autorização

Requer o seguinte âmbito do OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para mais informações, consulte o Authentication Overview.

Autorizações de IAM

Requer a seguinte autorização de IAM no recurso name:

  • speech.phraseSets.update

Para mais informações, consulte a documentação do IAM.

UpdateRecognizer

rpc UpdateRecognizer(UpdateRecognizerRequest) returns (Operation)

Atualiza o Recognizer.

Âmbitos de autorização

Requer o seguinte âmbito do OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para mais informações, consulte o Authentication Overview.

Autorizações de IAM

Requer a seguinte autorização de IAM no recurso name:

  • speech.recognizers.update

Para mais informações, consulte a documentação do IAM.

AccessMetadata

Os metadados de acesso de uma região específica. Isto pode ser aplicado se a política da organização para o projeto especificado não permitir uma região específica.

Campos
constraint_type

ConstraintType

Descreve os diferentes tipos de restrições que são aplicadas.

ConstraintType

Descreve os diferentes tipos de restrições que podem ser aplicadas numa região.

Enumerações
CONSTRAINT_TYPE_UNSPECIFIED Restrição não especificada aplicada.
RESOURCE_LOCATIONS_ORG_POLICY_CREATE_CONSTRAINT A política organizacional do projeto não permite a região especificada.

AutoDetectDecodingConfig

Este tipo não tem campos.

Parâmetros de descodificação detetados automaticamente. Suportado para as seguintes codificações:

  • WAV_LINEAR16: amostras PCM de 16 bits com sinal little-endian num contentor WAV.

  • WAV_MULAW: amostras mulaw comprimidas de 8 bits num contentor WAV.

  • WAV_ALAW: amostras alaw comprimidas de 8 bits num contentor WAV.

  • RFC4867_5_AMR: frames AMR com um cabeçalho rfc4867.5.

  • RFC4867_5_AMRWB: frames AMR-WB com um cabeçalho rfc4867.5.

  • FLAC: frames FLAC no formato de contentor "FLAC nativo".

  • MP3: frames de áudio MPEG com metadados ID3 opcionais (ignorados).

  • OGG_OPUS: frames de áudio Opus num contentor Ogg.

  • WEBM_OPUS: frames de áudio Opus num contentor WebM.

  • MP4_AAC: frames de áudio AAC num contentor MP4.

  • M4A_AAC: frames de áudio AAC num contentor M4A.

  • MOV_AAC: frames de áudio AAC num contentor MOV.

BatchRecognizeFileMetadata

Metadados sobre um único ficheiro num lote para BatchRecognize.

Campos
config

RecognitionConfig

Funcionalidades e metadados de áudio a usar para o reconhecimento de voz automático. Este campo, em combinação com o campo config_mask, pode ser usado para substituir partes do default_recognition_config do recurso Recognizer, bem como o config ao nível do pedido.

config_mask

FieldMask

A lista de campos em config que substituem os valores em default_recognition_config do reconhecedor durante este pedido de reconhecimento. Se não for fornecida nenhuma máscara, todos os campos com valores não predefinidos em config substituem os valores no reconhecedor para este pedido de reconhecimento. Se for fornecida uma máscara, apenas os campos indicados na máscara substituem a configuração no reconhecedor para este pedido de reconhecimento. Se for fornecido um caráter universal (*), config substitui completamente a configuração no reconhecedor para este pedido de reconhecimento.

Campo de união audio_source. A origem do áudio, que é um URI do Google Cloud Storage. audio_source só pode ser uma das seguintes opções:
uri

string

URI do Cloud Storage para o ficheiro de áudio.

BatchRecognizeFileResult

Resultados finais para um único ficheiro.

Campos
error

Status

Erro, se tiver sido encontrado um.

metadata

RecognitionResponseMetadata

uri
(deprecated)

string

Descontinuado. Em alternativa, use cloud_storage_result.native_format_uri.

transcript
(deprecated)

BatchRecognizeResults

Descontinuado. Em alternativa, use inline_result.transcript.

Campo de união result.

result só pode ser uma das seguintes opções:

cloud_storage_result

CloudStorageResult

Resultados do reconhecimento escritos no Cloud Storage. Este campo só é preenchido quando GcsOutputConfig está definido em [RecognitionOutputConfig][google.cloud.speech.v2.RecognitionOutputConfig.

inline_result

InlineResult

Resultados do reconhecimento. Este campo só é preenchido quando InlineOutputConfig está definido em [RecognitionOutputConfig][google.cloud.speech.v2.RecognitionOutputConfig.

BatchRecognizeMetadata

Metadados da operação para BatchRecognize.

Campos
transcription_metadata

map<string, BatchRecognizeTranscriptionMetadata>

Mapeamento do nome do ficheiro fornecido para os metadados de transcrição desse ficheiro.

BatchRecognizeRequest

Mensagem de pedido para o método BatchRecognize.

Campos
recognizer

string

Obrigatório. O nome do Recognizer a usar durante o reconhecimento. O formato esperado é projects/{project}/locations/{location}/recognizers/{recognizer}. O segmento {recognizer} pode ser definido como _ para usar um Recognizer implícito vazio.

config

RecognitionConfig

Funcionalidades e metadados de áudio a usar para o reconhecimento de voz automático. Este campo, em combinação com o campo config_mask, pode ser usado para substituir partes do default_recognition_config do recurso Recognizer.

config_mask

FieldMask

A lista de campos em config que substituem os valores em default_recognition_config do reconhecedor durante este pedido de reconhecimento. Se não for fornecida nenhuma máscara, todos os campos indicados em config substituem os valores no reconhecedor para este pedido de reconhecimento. Se for fornecida uma máscara, apenas os campos indicados na máscara substituem a configuração no reconhecedor para este pedido de reconhecimento. Se for fornecido um caráter universal (*), config substitui completamente a configuração no reconhecedor para este pedido de reconhecimento.

files[]

BatchRecognizeFileMetadata

Ficheiros de áudio com metadados de ficheiros para ASR. O número máximo de ficheiros que podem ser especificados é 15.

recognition_output_config

RecognitionOutputConfig

Opções de configuração para onde gerar as transcrições de cada ficheiro.

processing_strategy

ProcessingStrategy

Estratégia de processamento a usar para este pedido.

ProcessingStrategy

Possíveis estratégias de processamento para pedidos em lote.

Enumerações
PROCESSING_STRATEGY_UNSPECIFIED Valor predefinido para a estratégia de processamento. O pedido é processado assim que é recebido.
DYNAMIC_BATCHING Se selecionada, processa o pedido durante períodos de utilização mais baixos para um desconto no preço. O pedido é processado no prazo de 24 horas.

BatchRecognizeResponse

Mensagem de resposta para BatchRecognize que é incluída num Operation de execução prolongada.

Campos
results

map<string, BatchRecognizeFileResult>

Mapeamento do nome do ficheiro para o resultado final desse ficheiro.

total_billed_duration

Duration

Quando disponíveis, segundos de áudio faturados para o pedido correspondente.

BatchRecognizeResults

Tipo de saída para o Cloud Storage das transcrições do BatchRecognize. Embora este proto não seja devolvido em nenhum lugar desta API, as transcrições do Cloud Storage são este proto serializado e devem ser analisadas como tal.

Campos
results[]

SpeechRecognitionResult

Lista sequencial de resultados da transcrição correspondentes a partes sequenciais do áudio.

metadata

RecognitionResponseMetadata

Metadados sobre o reconhecimento.

BatchRecognizeTranscriptionMetadata

Metadados sobre a transcrição de um único ficheiro (por exemplo, percentagem de progresso).

Campos
progress_percent

int32

A quantidade do ficheiro que já foi transcrita.

error

Status

Erro, se tiver sido encontrado um.

uri

string

O URI do Cloud Storage para o qual os resultados do reconhecimento vão ser escritos.

CloudStorageResult

Resultados finais escritos no Cloud Storage.

Campos
uri

string

O URI do Cloud Storage para o qual os resultados do reconhecimento foram escritos.

vtt_format_uri

string

O URI do Cloud Storage para o qual os resultados do reconhecimento foram escritos como legendas formatadas VTT. Este campo é preenchido apenas quando é pedida a saída VTT.

srt_format_uri

string

O URI do Cloud Storage para o qual os resultados do reconhecimento foram escritos como legendas formatadas em SRT. Este campo é preenchido apenas quando é pedida a saída SRT.

Configuração

Mensagem que representa a configuração da API Speech-to-Text. Isto inclui uma chave do KMS opcional com a qual os dados recebidos são encriptados.

Campos
name

string

Apenas saída. Identificador. O nome do recurso de configuração. Existe exatamente um recurso de configuração por projeto e por localização. O formato esperado é projects/{project}/locations/{location}/config.

kms_key_name

string

Opcional. Um nome da chave do KMS opcional que, se estiver presente, é usado para encriptar recursos de conversão de voz em texto em repouso. A atualização desta chave não encripta os recursos existentes que a usam. Apenas os novos recursos são encriptados com esta chave. O formato esperado é projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

update_time

Timestamp

Apenas saída. A hora mais recente em que este recurso foi modificado.

CreateCustomClassRequest

Mensagem de pedido para o método CreateCustomClass.

Campos
custom_class

CustomClass

Obrigatório. O CustomClass a criar.

validate_only

bool

Se estiver definido, valida o pedido e pré-visualiza o CustomClass, mas não o cria efetivamente.

custom_class_id

string

O ID a usar para a CustomClass, que se torna o componente final do nome do recurso da CustomClass.

Este valor deve ter entre 4 e 63 carateres, e os carateres válidos são /[a-z][0-9]-/.

parent

string

Obrigatório. O projeto e a localização onde esta CustomClass vai ser criada. O formato esperado é projects/{project}/locations/{location}.

CreatePhraseSetRequest

Mensagem de pedido para o método CreatePhraseSet.

Campos
phrase_set

PhraseSet

Obrigatório. O PhraseSet a criar.

validate_only

bool

Se estiver definido, valida o pedido e pré-visualiza o PhraseSet, mas não o cria efetivamente.

phrase_set_id

string

O ID a usar para o PhraseSet, que se torna o componente final do nome do recurso do PhraseSet.

Este valor deve ter entre 4 e 63 carateres, e os carateres válidos são /[a-z][0-9]-/.

parent

string

Obrigatório. O projeto e a localização onde este PhraseSet vai ser criado. O formato esperado é projects/{project}/locations/{location}.

CreateRecognizerRequest

Mensagem de pedido para o método CreateRecognizer.

Campos
recognizer

Recognizer

Obrigatório. O Recognizer a criar.

validate_only

bool

Se estiver definido, valida o pedido e pré-visualiza o Recognizer, mas não o cria efetivamente.

recognizer_id

string

O ID a usar para o Recognizer, que se torna o componente final do nome do recurso do Recognizer.

Este valor deve ter entre 4 e 63 carateres, e os carateres válidos são /[a-z][0-9]-/.

parent

string

Obrigatório. O projeto e a localização onde este Recognizer vai ser criado. O formato esperado é projects/{project}/locations/{location}.

CustomClass

CustomClass para a definição de preferências no reconhecimento de voz. Usado para definir um conjunto de palavras ou expressões que representam um conceito ou um tema comum que é provável que apareça no seu áudio, por exemplo, uma lista de nomes de navios de passageiros.

Campos
name

string

Apenas saída. Identificador. O nome do recurso da CustomClass. Formato: projects/{project}/locations/{location}/customClasses/{custom_class}.

uid

string

Apenas saída. Identificador exclusivo atribuído pelo sistema para o CustomClass.

display_name

string

Opcional. Nome legível e configurável pelo utilizador para a CustomClass. Tem de ter 63 carateres ou menos.

items[]

ClassItem

Uma coleção de itens de classe.

state

State

Apenas saída. O estado do ciclo de vida de CustomClass.

create_time

Timestamp

Apenas saída. Hora de criação.

update_time

Timestamp

Apenas saída. A hora mais recente em que este recurso foi modificado.

delete_time

Timestamp

Apenas saída. A hora em que este recurso foi pedido para eliminação.

expire_time

Timestamp

Apenas saída. A hora em que este recurso vai ser anulado.

annotations

map<string, string>

Opcional. Permite que os utilizadores armazenem pequenas quantidades de dados arbitrários. Tanto a chave como o valor têm de ter, no máximo, 63 carateres. No máximo, 100 anotações.

etag

string

Apenas saída. Esta soma de verificação é calculada pelo servidor com base no valor de outros campos. Isto pode ser enviado em pedidos de atualização, anulação da eliminação e eliminação para garantir que o cliente tem um valor atualizado antes de continuar.

reconciling

bool

Apenas saída. Indica se esta CustomClass está ou não em processo de atualização.

kms_key_name

string

Apenas saída. O nome da chave do KMS com a qual a CustomClass está encriptada. O formato esperado é projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

kms_key_version_name

string

Apenas saída. O nome da versão da chave do KMS com a qual a CustomClass está encriptada. O formato esperado é projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}/cryptoKeyVersions/{crypto_key_version}.

ClassItem

Um item da classe.

Campos
value

string

O valor do artigo da classe.

Estado

Conjunto de estados que definem o ciclo de vida de uma CustomClass.

Enumerações
STATE_UNSPECIFIED Estado não especificado. Isto só é usado/útil para distinguir valores não definidos.
ACTIVE O estado normal e ativo.
DELETED Esta CustomClass foi eliminada.

DeleteCustomClassRequest

Mensagem de pedido para o método DeleteCustomClass.

Campos
name

string

Obrigatório. O nome da CustomClass a eliminar. Formato: projects/{project}/locations/{location}/customClasses/{custom_class}

validate_only

bool

Se estiver definido, valida o pedido e pré-visualiza a CustomClass eliminada, mas não a elimina efetivamente.

allow_missing

bool

Se for definida como verdadeira e a CustomClass não for encontrada, o pedido é bem-sucedido e não é realizada nenhuma operação (neste caso, não é registada nenhuma operação).

etag

string

Esta soma de verificação é calculada pelo servidor com base no valor de outros campos. Isto pode ser enviado em pedidos de atualização, anulação da eliminação e eliminação para garantir que o cliente tem um valor atualizado antes de continuar.

DeletePhraseSetRequest

Mensagem de pedido para o método DeletePhraseSet.

Campos
name

string

Obrigatório. O nome do PhraseSet a eliminar. Formato: projects/{project}/locations/{location}/phraseSets/{phrase_set}

validate_only

bool

Se definido, valida o pedido e pré-visualiza o PhraseSet eliminado, mas não o elimina efetivamente.

allow_missing

bool

Se estiver definida como verdadeira e o PhraseSet não for encontrado, o pedido é bem-sucedido e não é realizada nenhuma operação (neste caso, não é registada nenhuma operação).

etag

string

Esta soma de verificação é calculada pelo servidor com base no valor de outros campos. Isto pode ser enviado em pedidos de atualização, anulação da eliminação e eliminação para garantir que o cliente tem um valor atualizado antes de continuar.

DeleteRecognizerRequest

Mensagem de pedido para o método DeleteRecognizer.

Campos
name

string

Obrigatório. O nome do identificador a eliminar. Formato: projects/{project}/locations/{location}/recognizers/{recognizer}

validate_only

bool

Se estiver definido, valida o pedido e pré-visualiza o Recognizer eliminado, mas não o elimina efetivamente.

allow_missing

bool

Se estiver definido como verdadeiro e o Recognizer não for encontrado, o pedido é bem-sucedido e não é realizada nenhuma operação (neste caso, não é registada nenhuma operação).

etag

string

Esta soma de verificação é calculada pelo servidor com base no valor de outros campos. Isto pode ser enviado em pedidos de atualização, anulação da eliminação e eliminação para garantir que o cliente tem um valor atualizado antes de continuar.

DenoiserConfig

Configuração do redutor de ruído. Pode não ser compatível com todos os modelos e pode não ter efeito.

Campos
denoise_audio

bool

Remover o ruído do áudio antes de o enviar para o modelo de transcrição.

snr_threshold

float

Limite da relação sinal/ruído (SNR) para o redutor de ruído. Aqui, a SNR significa o volume do sinal de voz. O áudio com uma SNR abaixo deste limite, o que significa que a voz está demasiado baixa, não é enviado para o modelo de transcrição.

Se snr_threshold=0, não é aplicado nenhum filtro.

ExplicitDecodingConfig

Parâmetros de descodificação especificados explicitamente.

Campos
encoding

AudioEncoding

Obrigatório. Codificação dos dados de áudio enviados para reconhecimento.

sample_rate_hertz

int32

Opcional. Taxa de amostragem em Hertz dos dados de áudio enviados para reconhecimento. Os valores válidos são: 8000 a 48 000, sendo 16 000 o valor ideal. Para os melhores resultados, defina a taxa de amostragem da fonte de áudio para 16 000 Hz. Se tal não for possível, use a taxa de amostragem nativa da fonte de áudio (em vez de reamostragem). Tenha em atenção que este campo está marcado como OPCIONAL por motivos de retrocompatibilidade. É (e sempre foi) efetivamente OBRIGATÓRIO.

audio_channel_count

int32

Opcional. Número de canais presentes nos dados de áudio enviados para reconhecimento. Tenha em atenção que este campo está marcado como OPCIONAL por motivos de retrocompatibilidade. É (e sempre foi) efetivamente OBRIGATÓRIO.

O valor máximo permitido é 8.

AudioEncoding

Codificações de dados de áudio suportadas.

Enumerações
AUDIO_ENCODING_UNSPECIFIED Valor predefinido. Este valor não é usado.
LINEAR16 Amostras PCM de 16 bits assinadas little-endian sem cabeçalho.
MULAW Exemplos de mulaw comprimidos de 8 bits sem cabeçalho.
ALAW Exemplos de alaw comprimido de 8 bits sem cabeçalho.
AMR Frames AMR com um cabeçalho rfc4867.5.
AMR_WB Frames AMR-WB com um cabeçalho rfc4867.5.
FLAC Frames FLAC no formato de contentor "FLAC nativo".
MP3 Frames de áudio MPEG com metadados ID3 opcionais (ignorados).
OGG_OPUS Frames de áudio Opus num contentor Ogg.
WEBM_OPUS Frames de áudio Opus num contentor WebM.
MP4_AAC Frames de áudio AAC num contentor MP4.
M4A_AAC Frames de áudio AAC num contentor M4A.
MOV_AAC Frames de áudio AAC num contentor MOV.

GcsOutputConfig

Configurações de saída para o Cloud Storage.

Campos
uri

string

O prefixo do URI do Cloud Storage com o qual os resultados do reconhecimento vão ser escritos.

GetConfigRequest

Mensagem de pedido para o método GetConfig.

Campos
name

string

Obrigatório. O nome da configuração a obter. Existe exatamente um recurso de configuração por projeto e por localização. O formato esperado é projects/{project}/locations/{location}/config.

GetCustomClassRequest

Mensagem de pedido para o método GetCustomClass.

Campos
name

string

Obrigatório. O nome da CustomClass a obter. O formato esperado é projects/{project}/locations/{location}/customClasses/{custom_class}.

GetPhraseSetRequest

Mensagem de pedido para o método GetPhraseSet.

Campos
name

string

Obrigatório. O nome do PhraseSet a obter. O formato esperado é projects/{project}/locations/{location}/phraseSets/{phrase_set}.

GetRecognizerRequest

Mensagem de pedido para o método GetRecognizer.

Campos
name

string

Obrigatório. O nome do Recognizer a obter. O formato esperado é projects/{project}/locations/{location}/recognizers/{recognizer}.

InlineOutputConfig

Este tipo não tem campos.

Configurações de saída para resposta inline.

InlineResult

Resultados finais devolvidos inline na resposta de reconhecimento.

Campos
transcript

BatchRecognizeResults

A transcrição do ficheiro de áudio.

vtt_captions

string

A transcrição do ficheiro de áudio como legendas formatadas em VTT. Este campo é preenchido apenas quando é pedida a saída VTT.

srt_captions

string

A transcrição do ficheiro de áudio como legendas formatadas em SRT. Este campo é preenchido apenas quando é pedida a saída SRT.

LanguageMetadata

Os metadados sobre os locais disponíveis numa determinada região. Atualmente, estes são apenas os modelos disponíveis para cada localidade

Campos
models

map<string, ModelMetadata>

Mapeamento de local (código de idioma) -> modelos

ListCustomClassesRequest

Mensagem de pedido para o método ListCustomClasses.

Campos
parent

string

Obrigatório. O projeto e a localização dos recursos CustomClass a apresentar. O formato esperado é projects/{project}/locations/{location}.

page_size

int32

Número de resultados por pedido. Um page_size válido varia entre 0 e 100, inclusive. Se o page_size for zero ou não especificado, é escolhido um tamanho de página de 5. Se o tamanho da página exceder 100, é reduzido para 100. Tenha em atenção que uma chamada pode devolver menos resultados do que o tamanho da página pedido.

page_token

string

Um token de página, recebido de uma chamada ListCustomClasses anterior. Faculte este valor para obter a página seguinte.

Quando paginar, todos os outros parâmetros fornecidos a ListCustomClasses têm de corresponder à chamada que forneceu o token da página.

show_deleted

bool

Se devem ou não ser apresentados os recursos que foram eliminados.

ListCustomClassesResponse

Mensagem de resposta para o método ListCustomClasses.

Campos
custom_classes[]

CustomClass

A lista de CustomClasses pedidas.

next_page_token

string

Um token que pode ser enviado como page_token para obter a página seguinte. Se este campo for omitido, não existem páginas subsequentes. Este token expira após 72 horas.

ListPhraseSetsRequest

Mensagem de pedido para o método ListPhraseSets.

Campos
parent

string

Obrigatório. O projeto e a localização dos recursos PhraseSet a listar. O formato esperado é projects/{project}/locations/{location}.

page_size

int32

O número máximo de PhraseSets a devolver. O serviço pode devolver um número inferior a este valor. Se não for especificado, são devolvidos, no máximo, 5 PhraseSets. O valor máximo é 100. Os valores superiores a 100 são forçados a 100.

page_token

string

Um token de página, recebido de uma chamada ListPhraseSets anterior. Faculte este valor para obter a página seguinte.

Quando paginar, todos os outros parâmetros fornecidos a ListPhraseSets têm de corresponder à chamada que forneceu o token da página.

show_deleted

bool

Se devem ou não ser apresentados os recursos que foram eliminados.

ListPhraseSetsResponse

Mensagem de resposta para o método ListPhraseSets.

Campos
phrase_sets[]

PhraseSet

A lista de PhraseSets pedidos.

next_page_token

string

Um token que pode ser enviado como page_token para obter a página seguinte. Se este campo for omitido, não existem páginas subsequentes. Este token expira após 72 horas.

ListRecognizersRequest

Mensagem de pedido para o método ListRecognizers.

Campos
parent

string

Obrigatório. O projeto e a localização dos reconhecedores a listar. O formato esperado é projects/{project}/locations/{location}.

page_size

int32

O número máximo de Recognizers a devolver. O serviço pode devolver um número inferior a este valor. Se não for especificado, são devolvidos, no máximo, 5 Recognizers. O valor máximo é 100. Os valores superiores a 100 são forçados a 100.

page_token

string

Um token de página, recebido de uma chamada ListRecognizers anterior. Faculte este valor para obter a página seguinte.

Quando paginar, todos os outros parâmetros fornecidos a ListRecognizers têm de corresponder à chamada que forneceu o token da página.

show_deleted

bool

Se devem ou não ser apresentados os recursos que foram eliminados.

ListRecognizersResponse

Mensagem de resposta para o método ListRecognizers.

Campos
recognizers[]

Recognizer

A lista de reconhecedores pedidos.

next_page_token

string

Um token que pode ser enviado como page_token para obter a página seguinte. Se este campo for omitido, não existem páginas subsequentes. Este token expira após 72 horas.

LocationsMetadata

Metadados principais para a API Locations para STT V2. Atualmente, trata-se apenas dos metadados sobre locais, modelos e funcionalidades

Campos
languages

LanguageMetadata

Informações sobre os locais, os modelos e as funcionalidades disponíveis representados na estrutura hierárquica de locais -> modelos -> funcionalidades

access_metadata

AccessMetadata

Informações sobre os metadados de acesso para a região e o projeto especificados.

ModelFeature

Representa uma funcionalidade singular de um modelo. Se a funcionalidade for recognizer, o release_state da funcionalidade representa o release_state do modelo

Campos
feature

string

O nome da funcionalidade (nota: a funcionalidade pode ser recognizer)

release_state

string

O estado de lançamento da funcionalidade

ModelFeatures

Representa a coleção de funcionalidades pertencentes a um modelo

Campos
model_feature[]

ModelFeature

Campo repetido que contém todas as funcionalidades do modelo

ModelMetadata

Os metadados sobre os modelos numa determinada região para um local específico. Atualmente, estas são apenas as funcionalidades do modelo

Campos
model_features

map<string, ModelFeatures>

Mapeamento do nome do modelo -> funcionalidades desse modelo

NativeOutputFileFormatConfig

Este tipo não tem campos.

Configurações de saída para protos BatchRecognizeResults serializados.

OperationMetadata

Representa os metadados de uma operação de longa duração.

Campos
create_time

Timestamp

A hora em que a operação foi criada.

update_time

Timestamp

A hora da última atualização da operação.

resource

string

O caminho do recurso para o destino da operação.

method

string

O método que acionou a operação.

kms_key_name

string

O nome da chave do KMS com a qual o conteúdo da operação está encriptado. O formato esperado é projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

kms_key_version_name

string

O nome da versão da chave do KMS com a qual o conteúdo da operação é encriptado. O formato esperado é projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}/cryptoKeyVersions/{crypto_key_version}.

progress_percent

int32

A percentagem de progresso da operação. Os valores podem variar entre 0 e 100. Se o valor for 100, a operação está concluída.

Campo de união request. O pedido que gerou a operação. request só pode ser uma das seguintes opções:
batch_recognize_request

BatchRecognizeRequest

O BatchRecognizeRequest que gerou a operação.

create_recognizer_request

CreateRecognizerRequest

O CreateRecognizerRequest que gerou a operação.

update_recognizer_request

UpdateRecognizerRequest

O UpdateRecognizerRequest que gerou a operação.

delete_recognizer_request

DeleteRecognizerRequest

O DeleteRecognizerRequest que gerou a operação.

undelete_recognizer_request

UndeleteRecognizerRequest

O UndeleteRecognizerRequest que gerou a operação.

create_custom_class_request

CreateCustomClassRequest

O CreateCustomClassRequest que gerou a operação.

update_custom_class_request

UpdateCustomClassRequest

O UpdateCustomClassRequest que gerou a operação.

delete_custom_class_request

DeleteCustomClassRequest

O DeleteCustomClassRequest que gerou a operação.

undelete_custom_class_request

UndeleteCustomClassRequest

O UndeleteCustomClassRequest que gerou a operação.

create_phrase_set_request

CreatePhraseSetRequest

O CreatePhraseSetRequest que gerou a operação.

update_phrase_set_request

UpdatePhraseSetRequest

O UpdatePhraseSetRequest que gerou a operação.

delete_phrase_set_request

DeletePhraseSetRequest

O DeletePhraseSetRequest que gerou a operação.

undelete_phrase_set_request

UndeletePhraseSetRequest

O UndeletePhraseSetRequest que gerou a operação.

update_config_request
(deprecated)

UpdateConfigRequest

O UpdateConfigRequest que gerou a operação.

Campo de união metadata. Metadados específicos por RPC. metadata só pode ser uma das seguintes opções:
batch_recognize_metadata

BatchRecognizeMetadata

Metadados específicos do método BatchRecognize.

OutputFormatConfig

Configuração do formato dos resultados armazenados em output.

Campos
native

NativeOutputFileFormatConfig

Configuração para o formato de saída nativo. Se este campo estiver definido ou se nenhum outro campo de formato de saída estiver definido, as transcrições são escritas no destino no formato nativo.

vtt

VttOutputFileFormatConfig

Configuração para o formato de saída VTT. Se este campo estiver definido, as transcrições são escritas no destino no formato VTT.

srt

SrtOutputFileFormatConfig

Configuração para o formato de saída SRT. Se este campo estiver definido, as transcrições são escritas no destino no formato SRT.

PhraseSet

PhraseSet para a definição de preferências no reconhecimento de voz. Um PhraseSet é usado para fornecer "sugestões" ao reconhecedor de voz para favorecer palavras e expressões específicas nos resultados.

Campos
name

string

Apenas saída. Identificador. O nome do recurso do PhraseSet. Formato: projects/{project}/locations/{location}/phraseSets/{phrase_set}.

uid

string

Apenas saída. Identificador exclusivo atribuído pelo sistema para o PhraseSet.

phrases[]

Phrase

Uma lista de palavras e expressões.

boost

float

Hint Boost. Um valor positivo aumenta a probabilidade de uma expressão específica ser reconhecida em detrimento de outras expressões com um som semelhante. Quanto maior for o aumento, maior é a probabilidade de reconhecimento de falsos positivos. Os valores boost válidos estão entre 0 (exclusivo) e 20. Recomendamos que use uma abordagem de pesquisa binária para encontrar o valor ideal para o seu exemplo de utilização, bem como adicionar expressões com e sem aumento aos seus pedidos.

display_name

string

Nome legível definido pelo utilizador para o PhraseSet. Tem de ter 63 carateres ou menos.

state

State

Apenas saída. O estado do ciclo de vida do PhraseSet.

create_time

Timestamp

Apenas saída. Hora de criação.

update_time

Timestamp

Apenas saída. A hora mais recente em que este recurso foi modificado.

delete_time

Timestamp

Apenas saída. A hora em que este recurso foi pedido para eliminação.

expire_time

Timestamp

Apenas saída. A hora em que este recurso vai ser anulado.

annotations

map<string, string>

Permite que os utilizadores armazenem pequenas quantidades de dados arbitrários. Tanto a chave como o valor têm de ter, no máximo, 63 carateres. No máximo, 100 anotações.

etag

string

Apenas saída. Esta soma de verificação é calculada pelo servidor com base no valor de outros campos. Isto pode ser enviado em pedidos de atualização, anulação da eliminação e eliminação para garantir que o cliente tem um valor atualizado antes de continuar.

reconciling

bool

Apenas saída. Indica se este PhraseSet está ou não em processo de atualização.

kms_key_name

string

Apenas saída. O nome da chave do KMS com a qual o PhraseSet está encriptado. O formato esperado é projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

kms_key_version_name

string

Apenas saída. O nome da versão da chave do KMS com a qual o PhraseSet está encriptado. O formato esperado é projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}/cryptoKeyVersions/{crypto_key_version}.

Expressão

Uma expressão contém palavras e "sugestões" de expressões para que o reconhecimento de voz tenha maior probabilidade de as reconhecer. Isto pode ser usado para melhorar a precisão de palavras e expressões específicas, por exemplo, se comandos específicos forem normalmente falados pelo utilizador. Também pode usar esta funcionalidade para adicionar palavras adicionais ao vocabulário do reconhecedor.

Os itens da lista também podem incluir referências CustomClass que contêm grupos de palavras que representam conceitos comuns que ocorrem na linguagem natural.

Campos
value

string

A própria expressão.

boost

float

Hint Boost. Substitui o aumento definido ao nível do conjunto de expressões. Um valor positivo aumenta a probabilidade de uma expressão específica ser reconhecida em detrimento de outras expressões com um som semelhante. Quanto maior for o aumento, maior é a probabilidade de reconhecimento de falsos positivos. Os valores de aumento negativos correspondem à eliminação de parcialidade. A eliminação de parcialidades não está ativada, pelo que os valores de aumento negativos devolvem um erro. Os valores de aumento têm de estar entre 0 e 20. Quaisquer valores fora desse intervalo devolvem um erro. Recomendamos que use uma abordagem de pesquisa binária para encontrar o valor ideal para o seu exemplo de utilização, bem como adicionar expressões com e sem aumento aos seus pedidos.

Estado

Conjunto de estados que definem o ciclo de vida de um PhraseSet.

Enumerações
STATE_UNSPECIFIED Estado não especificado. Isto só é usado/útil para distinguir valores não definidos.
ACTIVE O estado normal e ativo.
DELETED Este PhraseSet foi eliminado.

RecognitionConfig

Fornece informações ao Recognizer que especificam como processar o pedido de reconhecimento.

Campos
model

string

Opcional. Que modelo usar para pedidos de reconhecimento. Selecione o modelo mais adequado ao seu domínio para obter os melhores resultados.

Pode encontrar orientações para escolher o modelo a usar na documentação dos modelos de transcrição, e os modelos suportados em cada região podem ser encontrados na tabela de modelos suportados.

language_codes[]

string

Opcional. O idioma do áudio fornecido como uma etiqueta de idioma BCP-47. As etiquetas de idioma são normalizadas para BCP-47 antes de serem usadas. Por exemplo, "en-us" torna-se "en-US".

Os idiomas suportados para cada modelo estão indicados na tabela de modelos suportados.

Se forem fornecidos idiomas adicionais, o resultado do reconhecimento contém o reconhecimento no idioma mais provável detetado. O resultado do reconhecimento inclui a etiqueta de idioma do idioma detetado no áudio.

features

RecognitionFeatures

Funcionalidades de reconhecimento de voz a ativar.

adaptation

SpeechAdaptation

Contexto de adaptação da voz que pondera as previsões do reconhecedor para palavras e expressões específicas.

transcript_normalization

TranscriptNormalization

Opcional. Use a normalização da transcrição para substituir automaticamente partes da transcrição por expressões à sua escolha. Para o StreamingRecognize, esta normalização aplica-se apenas a transcrições parciais estáveis (estabilidade > 0,8) e transcrições finais.

translation_config

TranslationConfig

Opcional. Configuração opcional usada para executar automaticamente a tradução no áudio fornecido para o idioma desejado para modelos suportados.

denoiser_config

DenoiserConfig

Opcional. Configuração opcional do cancelamento de ruído. Pode não ser compatível com todos os modelos e pode não ter efeito.

Campo de união decoding_config. Parâmetros de descodificação do áudio enviado para reconhecimento. decoding_config só pode ser uma das seguintes opções:
auto_decoding_config

AutoDetectDecodingConfig

Detetar automaticamente os parâmetros de descodificação. Preferível para formatos suportados.

explicit_decoding_config

ExplicitDecodingConfig

Parâmetros de descodificação especificados explicitamente. Obrigatório se usar áudio PCM sem cabeçalho (linear16, mulaw, alaw).

RecognitionFeatures

Funcionalidades de reconhecimento disponíveis.

Campos
profanity_filter

bool

Se estiver definido como true, o servidor tenta filtrar as obscenidades, substituindo todos os carateres, exceto o inicial, em cada palavra filtrada por asteriscos, por exemplo, "f***". Se for definido como false ou omitido, as obscenidades não são filtradas.

enable_word_time_offsets

bool

Se true, o resultado principal inclui uma lista de palavras e os desvios de tempo de início e fim (indicações de tempo) dessas palavras. Se false, não são devolvidas informações de deslocamento de tempo ao nível da palavra. A predefinição é false.

enable_word_confidence

bool

Se true, o resultado principal inclui uma lista de palavras e a confiança para essas palavras. Se false, não são devolvidas informações de confiança ao nível da palavra. A predefinição é false.

enable_automatic_punctuation

bool

Se true, adiciona pontuação às hipóteses de resultados de reconhecimento. Esta funcionalidade só está disponível em determinados idiomas. O valor false predefinido não adiciona pontuação às hipóteses de resultados.

enable_spoken_punctuation

bool

O comportamento da pontuação falada para a chamada. Se true, substitui a pontuação falada pelos símbolos correspondentes no pedido. Por exemplo, "how are you question mark" torna-se "how are you?". Consulte https://cloud.google.com/speech-to-text/docs/spoken-punctuation para obter apoio técnico. Se false, a pontuação falada não é substituída.

enable_spoken_emojis

bool

O comportamento dos emojis falados para a chamada. Se true, adiciona formatação de emojis falados ao pedido. Esta ação substitui os emojis falados pelos símbolos Unicode correspondentes na transcrição final. Se false, os emojis falados não são substituídos.

multi_channel_mode

MultiChannelMode

Modo para reconhecer áudio multicanal.

diarization_config

SpeakerDiarizationConfig

Configuração para ativar a separação de oradores. Para ativar a separação de oradores, defina este campo para uma mensagem SpeakerDiarizationConfig vazia.

max_alternatives

int32

Número máximo de hipóteses de reconhecimento a devolver. O servidor pode devolver menos de max_alternatives. Os valores válidos são 0-30. Um valor de 0 ou 1 devolve um máximo de um. Se for omitido, devolve um máximo de um.

MultiChannelMode

Opções para reconhecer áudio multicanal.

Enumerações
MULTI_CHANNEL_MODE_UNSPECIFIED Valor predefinido para o modo multicanal. Se o áudio contiver vários canais, apenas o primeiro canal é transcrito. Os outros canais são ignorados.
SEPARATE_RECOGNITION_PER_CHANNEL Se esta opção for selecionada, cada canal no áudio fornecido é transcrito de forma independente. Não é possível selecionar esta opção se o model selecionado for latest_short.

RecognitionOutputConfig

Opções de configuração para as saídas do reconhecimento.

Campos
output_format_config

OutputFormatConfig

Opcional. Configuração do formato dos resultados armazenados em output. Se não for especificado, as transcrições são escritas apenas no formato NATIVE.

Campo de união output.

output só pode ser uma das seguintes opções:

gcs_output_config

GcsOutputConfig

Se esta mensagem estiver preenchida, os resultados do reconhecimento são escritos no URI do Google Cloud Storage fornecido.

inline_response_config

InlineOutputConfig

Se esta mensagem estiver preenchida, os resultados do reconhecimento são fornecidos na mensagem BatchRecognizeResponse da operação quando estiver concluída. Esta funcionalidade só é suportada quando chama o BatchRecognize com apenas um ficheiro de áudio.

RecognitionResponseMetadata

Metadados sobre o pedido e a resposta de reconhecimento.

Campos
request_id

string

Identificador de pedido global gerado automaticamente pela API.

total_billed_duration

Duration

Quando disponíveis, segundos de áudio faturados para o pedido correspondente.

RecognizeRequest

Mensagem de pedido para o método Recognize. Tem de fornecer content ou uri. O fornecimento de ambas ou nenhuma das informações devolve INVALID_ARGUMENT. Consulte os limites de conteúdo.

Campos
recognizer

string

Obrigatório. O nome do Recognizer a usar durante o reconhecimento. O formato esperado é projects/{project}/locations/{location}/recognizers/{recognizer}. O segmento {recognizer} pode ser definido como _ para usar um Recognizer implícito vazio.

config

RecognitionConfig

Funcionalidades e metadados de áudio a usar para o reconhecimento de voz automático. Este campo, em combinação com o campo config_mask, pode ser usado para substituir partes do default_recognition_config do recurso Recognizer.

config_mask

FieldMask

A lista de campos em config que substituem os valores em default_recognition_config do reconhecedor durante este pedido de reconhecimento. Se não for fornecida nenhuma máscara, todos os campos com valores não predefinidos em config substituem os valores no reconhecedor para este pedido de reconhecimento. Se for fornecida uma máscara, apenas os campos indicados na máscara substituem a configuração no reconhecedor para este pedido de reconhecimento. Se for fornecido um caráter universal (*), config substitui completamente a configuração no reconhecedor para este pedido de reconhecimento.

Campo de união audio_source. A origem de áudio, que é conteúdo inline ou um URI do Google Cloud Storage. audio_source só pode ser uma das seguintes opções:
content

bytes

Os bytes de dados de áudio codificados conforme especificado em RecognitionConfig. Tal como acontece com todos os campos de bytes, os buffers proto usam uma representação binária pura, enquanto as representações JSON usam base64.

uri

string

URI que aponta para um ficheiro que contém bytes de dados de áudio, conforme especificado em RecognitionConfig. O ficheiro não pode estar comprimido (por exemplo, gzip). Atualmente, apenas são suportados URIs do Google Cloud Storage, que têm de ser especificados no seguinte formato: gs://bucket_name/object_name (outros formatos de URI devolvem INVALID_ARGUMENT). Para mais informações, consulte URIs de pedidos.

RecognizeResponse

Mensagem de resposta para o método Recognize.

Campos
results[]

SpeechRecognitionResult

Lista sequencial de resultados da transcrição correspondentes a partes sequenciais do áudio.

metadata

RecognitionResponseMetadata

Metadados sobre o reconhecimento.

Reconhecedor

Uma mensagem do Recognizer. Armazena a configuração e os metadados do reconhecimento.

Campos
name

string

Apenas saída. Identificador. O nome do recurso do Recognizer. Formato: projects/{project}/locations/{location}/recognizers/{recognizer}.

uid

string

Apenas saída. Identificador exclusivo atribuído pelo sistema para o Recognizer.

display_name

string

Nome legível e definível pelo utilizador para o Recognizer. Tem de ter 63 carateres ou menos.

model
(deprecated)

string

Opcional. Este campo foi descontinuado. Prefira o campo model na mensagem RecognitionConfig.

Que modelo usar para pedidos de reconhecimento. Selecione o modelo mais adequado ao seu domínio para obter os melhores resultados.

Pode encontrar orientações para escolher o modelo a usar na documentação dos modelos de transcrição, e os modelos suportados em cada região podem ser encontrados na tabela de modelos suportados.

language_codes[]
(deprecated)

string

Opcional. Este campo foi descontinuado. Prefira o campo language_codes na mensagem RecognitionConfig.

O idioma do áudio fornecido como uma etiqueta de idioma BCP-47.

Os idiomas suportados para cada modelo estão indicados na tabela de modelos suportados.

Se forem fornecidos idiomas adicionais, o resultado do reconhecimento contém o reconhecimento no idioma mais provável detetado. O resultado do reconhecimento inclui a etiqueta de idioma do idioma detetado no áudio. Quando cria ou atualiza um Recognizer, estes valores são armazenados no formato BCP-47 normalizado. Por exemplo, "en-us" é armazenado como "en-US".

default_recognition_config

RecognitionConfig

Configuração predefinida a usar para pedidos com este Recognizer. Isto pode ser substituído pela configuração inline no campo RecognizeRequest.config.

annotations

map<string, string>

Permite que os utilizadores armazenem pequenas quantidades de dados arbitrários. Tanto a chave como o valor têm de ter, no máximo, 63 carateres. No máximo, 100 anotações.

state

State

Apenas saída. O estado do ciclo de vida do Recognizer.

create_time

Timestamp

Apenas saída. Hora de criação.

update_time

Timestamp

Apenas saída. A hora mais recente em que este Recognizer foi modificado.

delete_time

Timestamp

Apenas saída. A hora em que este Recognizer foi pedido para eliminação.

expire_time

Timestamp

Apenas saída. A hora em que este Recognizer vai ser removido completamente.

etag

string

Apenas saída. Esta soma de verificação é calculada pelo servidor com base no valor de outros campos. Isto pode ser enviado em pedidos de atualização, anulação da eliminação e eliminação para garantir que o cliente tem um valor atualizado antes de continuar.

reconciling

bool

Apenas saída. Indica se este Recognizer está ou não em processo de atualização.

kms_key_name

string

Apenas saída. O nome da chave do KMS com a qual o Recognizer está encriptado. O formato esperado é projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

kms_key_version_name

string

Apenas saída. O nome da versão da chave do KMS com a qual o Recognizer está encriptado. O formato esperado é projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}/cryptoKeyVersions/{crypto_key_version}.

Estado

Conjunto de estados que definem o ciclo de vida de um Recognizer.

Enumerações
STATE_UNSPECIFIED O valor predefinido. Este valor é usado se o estado for omitido.
ACTIVE O Recognizer está ativo e pronto a ser usado.
DELETED Este identificador foi eliminado.

SpeakerDiarizationConfig

Configuração para ativar a separação de oradores.

Campos
min_speaker_count

int32

Opcional. O sistema determina automaticamente o número de oradores. Este valor não é usado atualmente.

max_speaker_count

int32

Opcional. O sistema determina automaticamente o número de oradores. Este valor não é usado atualmente.

SpeechAdaptation

Fornece "sugestões" ao reconhecedor de voz para favorecer palavras e expressões específicas nos resultados. Os PhraseSets podem ser especificados como um recurso inline ou uma referência a um recurso PhraseSet existente.

Campos
phrase_sets[]

AdaptationPhraseSet

Uma lista de PhraseSets inline ou referenciados.

custom_classes[]

CustomClass

Uma lista de CustomClasses inline. Os recursos CustomClass existentes podem ser referenciados diretamente num PhraseSet.

AdaptationPhraseSet

Um PhraseSet de parcialidade, que pode ser uma string que faz referência ao nome de um recurso PhraseSets existente ou uma definição inline de um PhraseSet.

Campos

Campo de união value.

value só pode ser uma das seguintes opções:

phrase_set

string

O nome de um recurso PhraseSet existente. O utilizador tem de ter acesso de leitura ao recurso e este não pode ser eliminado.

inline_phrase_set

PhraseSet

Um PhraseSet definido inline.

SpeechRecognitionAlternative

Hipóteses alternativas (também conhecidas como lista n-best).

Campos
transcript

string

Texto da transcrição que representa as palavras que o utilizador disse.

confidence

float

A estimativa de confiança entre 0,0 e 1,0. Um número mais elevado indica uma probabilidade estimada maior de que as palavras reconhecidas estejam corretas. Este campo só é definido para a principal alternativa de um resultado sem streaming ou de um resultado de streaming em que is_final está definido como true. Não é garantido que este campo seja preciso e os utilizadores não devem confiar que é sempre fornecido. O valor predefinido de 0,0 é um valor de controlo que indica que confidence não foi definido.

words[]

WordInfo

Uma lista de informações específicas de palavras para cada palavra reconhecida. Quando o SpeakerDiarizationConfig está definido, vê todas as palavras desde o início do áudio.

SpeechRecognitionResult

Um resultado de reconhecimento de voz correspondente a uma parte do áudio.

Campos
alternatives[]

SpeechRecognitionAlternative

Pode conter uma ou mais hipóteses de reconhecimento. Estas alternativas são ordenadas em termos de precisão, sendo a alternativa superior (primeira) a mais provável, de acordo com a classificação do reconhecedor.

channel_tag

int32

Para áudio multicanal, este é o número do canal correspondente ao resultado reconhecido para o áudio desse canal. Para audio_channel_count = N, os respetivos valores de saída podem variar entre 1 e N.

result_end_offset

Duration

Desvio de tempo do fim deste resultado relativamente ao início do áudio.

language_code

string

Apenas saída. A etiqueta de idioma BCP-47 do idioma neste resultado. Este código de idioma foi detetado como o mais provável de ser falado no áudio.

SrtOutputFileFormatConfig

Este tipo não tem campos.

Configurações de saída de um ficheiro de legendas formatado em texto SubRip.

StreamingRecognitionConfig

Fornece informações de configuração para o pedido StreamingRecognize.

Campos
config

RecognitionConfig

Obrigatório. Funcionalidades e metadados de áudio a usar para o reconhecimento de voz automático. Este campo, em combinação com o campo config_mask, pode ser usado para substituir partes do default_recognition_config do recurso Recognizer.

config_mask

FieldMask

A lista de campos em config que substituem os valores em default_recognition_config do reconhecedor durante este pedido de reconhecimento. Se não for fornecida nenhuma máscara, todos os campos com valores não predefinidos em config substituem os valores no Recognizer para este pedido de reconhecimento. Se for fornecida uma máscara, apenas os campos indicados na máscara substituem a configuração no Recognizer para este pedido de reconhecimento. Se for fornecido um caráter universal (*), config substitui completamente a configuração no reconhecedor para este pedido de reconhecimento.

streaming_features

StreamingRecognitionFeatures

Funcionalidades de reconhecimento de voz para ativar especificamente pedidos de reconhecimento de áudio em streaming.

StreamingRecognitionFeatures

Funcionalidades de reconhecimento disponíveis específicas para pedidos de reconhecimento de streaming.

Campos
enable_voice_activity_events

bool

Se true, as respostas com eventos de voz de atividade de voz são devolvidas à medida que são detetadas.

interim_results

bool

Se deve ou não transmitir resultados provisórios ao cliente. Se estiver definida como verdadeira, os resultados provisórios são transmitidos para o cliente. Caso contrário, apenas a resposta final é transmitida em fluxo contínuo.

voice_activity_timeout

VoiceActivityTimeout

Se estiver definido, o servidor fecha automaticamente a stream após a duração especificada decorrida após o envio do último evento de voz VOICE_ACTIVITY. O campo voice_activity_events também tem de estar definido como verdadeiro.

VoiceActivityTimeout

Eventos nos quais é possível definir um limite de tempo para a atividade de voz.

Campos
speech_start_timeout

Duration

Duração do limite de tempo da stream se não for iniciada nenhuma fala. Se esta opção estiver definida e não for detetada voz durante este período no início da stream, o servidor fecha a stream.

speech_end_timeout

Duration

Duração da pausa da stream após o fim da fala. Se esta opção estiver definida e não for detetada voz durante este período após a deteção de voz, o servidor fecha a stream.

StreamingRecognitionResult

Um resultado de reconhecimento de voz de streaming correspondente a uma parte do áudio que está a ser processada atualmente.

Campos
alternatives[]

SpeechRecognitionAlternative

Pode conter uma ou mais hipóteses de reconhecimento. Estas alternativas são ordenadas em termos de precisão, sendo a alternativa superior (primeira) a mais provável, de acordo com a classificação do reconhecedor.

is_final

bool

Se false, este StreamingRecognitionResult representa um resultado provisório que pode mudar. Se true, esta é a última vez que o serviço de voz devolve este StreamingRecognitionResult específico. O reconhecedor não devolve mais hipóteses para esta parte da transcrição e o áudio correspondente.

stability

float

Uma estimativa da probabilidade de o reconhecedor não alterar a sua suposição sobre este resultado provisório. Os valores variam entre 0,0 (completamente instável) e 1,0 (completamente estável). Este campo só é fornecido para resultados provisórios (is_final=false). O valor predefinido de 0,0 é um valor de controlo que indica que stability não foi definido.

result_end_offset

Duration

Desvio de tempo do fim deste resultado relativamente ao início do áudio.

channel_tag

int32

Para áudio multicanal, este é o número do canal correspondente ao resultado reconhecido para o áudio desse canal. Para audio_channel_count = N, os respetivos valores de saída podem variar entre 1 e N.

language_code

string

Apenas saída. A etiqueta de idioma BCP-47 do idioma neste resultado. Este código de idioma foi detetado como o mais provável de ser falado no áudio.

StreamingRecognizeRequest

Mensagem de pedido para o método StreamingRecognize. São enviadas várias mensagens StreamingRecognizeRequest numa chamada.

Se o Recognizer referenciado por recognizer contiver uma configuração de pedido totalmente especificada, a stream só pode conter mensagens com apenas audio definido.

Caso contrário, a primeira mensagem tem de conter uma mensagem recognizer e uma mensagem streaming_config que, em conjunto, especifiquem totalmente a configuração do pedido e não podem conter audio. Todas as mensagens subsequentes só podem ter o elemento audio definido.

Campos
recognizer

string

Obrigatório. O nome do Recognizer a usar durante o reconhecimento. O formato esperado é projects/{project}/locations/{location}/recognizers/{recognizer}. O segmento {recognizer} pode ser definido como _ para usar um Recognizer implícito vazio.

Campo de união streaming_request.

streaming_request só pode ser uma das seguintes opções:

streaming_config

StreamingRecognitionConfig

StreamingRecognitionConfig a usar nesta tentativa de reconhecimento. Se for fornecido, substitui o RecognitionConfig predefinido armazenado no Recognizer.

audio

bytes

Bytes de áudio inline a serem reconhecidos. O tamanho máximo deste campo é de 15 KB por pedido.

StreamingRecognizeResponse

StreamingRecognizeResponse é a única mensagem devolvida ao cliente por StreamingRecognize. Uma série de zero ou mais mensagens StreamingRecognizeResponse são transmitidas de volta ao cliente. Se não houver áudio reconhecível, não são transmitidas mensagens de volta para o cliente.

Seguem-se alguns exemplos de StreamingRecognizeResponses que podem ser devolvidos durante o processamento de áudio:

  1. results { alternatives { transcript: "tube" } stability: 0.01 }

  2. results { alternatives { transcript: "to be a" } stability: 0.01 }

  3. results { alternatives { transcript: "to be" } stability: 0.9 } results { alternatives { transcript: " or not to be" } stability: 0.01 }

  4. results { alternatives { transcript: "to be or not to be" confidence: 0.92 } alternatives { transcript: "to bee or not to bee" } is_final: true }

  5. results { alternatives { transcript: " that's" } stability: 0.01 }

  6. results { alternatives { transcript: " that is" } stability: 0.9 } results { alternatives { transcript: " the question" } stability: 0.01 }

  7. results { alternatives { transcript: " that is the question" confidence: 0.98 } alternatives { transcript: " that was the question" } is_final: true }

Notas:

  • Apenas duas das respostas acima, a n.º 4 e a n.º 7, contêm resultados finais. Estas estão indicadas com is_final: true. A concatenação destes elementos gera a transcrição completa: "ser ou não ser, eis a questão".

  • Os outros contêm dados provisórios results. Os exemplos n.º 3 e n.º 6 contêm dois results provisórios: a primeira parte tem uma estabilidade elevada e é menos provável que mude; a segunda parte tem uma estabilidade baixa e é muito provável que mude. Um designer de IU pode optar por mostrar apenas a estabilidade elevada results.

  • Os valores específicos de stability e confidence apresentados acima destinam-se apenas a fins ilustrativos. Os valores reais podem variar.

  • Em cada resposta, apenas um destes campos é definido: error, speech_event_type ou um ou mais (repetidos) results.

Campos
results[]

StreamingRecognitionResult

Esta lista repetida contém zero ou mais resultados que correspondem a partes consecutivas do áudio que está a ser processado. Contém zero ou um resultado is_final=true (a parte recentemente liquidada), seguido de zero ou mais resultados is_final=false (os resultados provisórios).

speech_event_type

SpeechEventType

Indica o tipo de evento de voz.

speech_event_offset

Duration

Desvio de tempo entre o início da emissão de áudio e de eventos.

metadata

RecognitionResponseMetadata

Metadados sobre o reconhecimento.

SpeechEventType

Indica o tipo de evento de voz.

Enumerações
SPEECH_EVENT_TYPE_UNSPECIFIED Nenhum evento de voz especificado.
END_OF_SINGLE_UTTERANCE Este evento indica que o servidor detetou o fim da expressão de voz do utilizador e não espera mais voz. Por conseguinte, o servidor não processa áudio adicional e fecha a stream bidirecional gRPC. Este evento só é enviado se tiver ocorrido uma interrupção forçada devido à deteção precoce de silêncio. Este evento só está disponível através da app latest_short model.
SPEECH_ACTIVITY_BEGIN Este evento indica que o servidor detetou o início da atividade de voz humana na stream. Este evento pode ser devolvido várias vezes se a fala começar e parar repetidamente ao longo da transmissão. Este evento só é enviado se voice_activity_events estiver definido como verdadeiro.
SPEECH_ACTIVITY_END Este evento indica que o servidor detetou o fim da atividade de voz humana na stream. Este evento pode ser devolvido várias vezes se a fala começar e parar repetidamente ao longo da transmissão. Este evento só é enviado se voice_activity_events estiver definido como verdadeiro.

TranscriptNormalization

Configuração de normalização da transcrição. Use a normalização da transcrição para substituir automaticamente partes da transcrição por expressões à sua escolha. Para o StreamingRecognize, esta normalização aplica-se apenas a transcrições parciais estáveis (estabilidade > 0,8) e transcrições finais.

Campos
entries[]

Entry

Uma lista de entradas de substituição. Vamos fazer a substituição com uma entrada de cada vez. Por exemplo, a segunda entrada em ["cat" => "dog", "mountain cat" => "mountain dog"] nunca é aplicada porque processamos sempre a primeira entrada antes. No máximo, 100 entradas.

Entrada

Uma única configuração de substituição.

Campos
search

string

O que substituir. O comprimento máximo é de 100 carateres.

replace

string

O que deve substituir. O comprimento máximo é de 100 carateres.

case_sensitive

bool

Se a pesquisa é sensível a maiúsculas e minúsculas.

TranslationConfig

Configuração da tradução. Use para traduzir o áudio fornecido em texto para o idioma pretendido.

Campos
target_language

string

Obrigatório. O código do idioma para o qual traduzir.

UndeleteCustomClassRequest

Mensagem de pedido para o método UndeleteCustomClass.

Campos
name

string

Obrigatório. O nome da classe personalizada a anular a eliminação. Formato: projects/{project}/locations/{location}/customClasses/{custom_class}

validate_only

bool

Se estiver definido, valida o pedido e pré-visualiza a CustomClass não eliminada, mas não a repõe efetivamente.

etag

string

Esta soma de verificação é calculada pelo servidor com base no valor de outros campos. Isto pode ser enviado em pedidos de atualização, anulação da eliminação e eliminação para garantir que o cliente tem um valor atualizado antes de continuar.

UndeletePhraseSetRequest

Mensagem de pedido para o método UndeletePhraseSet.

Campos
name

string

Obrigatório. O nome do PhraseSet a anular a eliminação. Formato: projects/{project}/locations/{location}/phraseSets/{phrase_set}

validate_only

bool

Se estiver definido, valida o pedido e pré-visualiza o PhraseSet não eliminado, mas não o elimina efetivamente.

etag

string

Esta soma de verificação é calculada pelo servidor com base no valor de outros campos. Isto pode ser enviado em pedidos de atualização, anulação da eliminação e eliminação para garantir que o cliente tem um valor atualizado antes de continuar.

UndeleteRecognizerRequest

Mensagem de pedido para o método UndeleteRecognizer.

Campos
name

string

Obrigatório. O nome do Recognizer a anular a eliminação. Formato: projects/{project}/locations/{location}/recognizers/{recognizer}

validate_only

bool

Se estiver definido, valida o pedido e pré-visualiza o Recognizer não eliminado, mas não o elimina efetivamente.

etag

string

Esta soma de verificação é calculada pelo servidor com base no valor de outros campos. Isto pode ser enviado em pedidos de atualização, anulação da eliminação e eliminação para garantir que o cliente tem um valor atualizado antes de continuar.

UpdateConfigRequest

Mensagem de pedido para o método UpdateConfig.

Campos
config

Config

Obrigatório. A configuração a atualizar.

O campo name da configuração é usado para identificar a configuração a ser atualizada. O formato esperado é projects/{project}/locations/{location}/config.

update_mask

FieldMask

A lista de campos a atualizar.

UpdateCustomClassRequest

Mensagem de pedido para o método UpdateCustomClass.

Campos
custom_class

CustomClass

Obrigatório. O CustomClass a atualizar.

O campo name de CustomClass é usado para identificar a CustomClass a atualizar. Formato: projects/{project}/locations/{location}/customClasses/{custom_class}.

update_mask

FieldMask

A lista de campos a atualizar. Se estiver vazio, todos os campos são considerados para atualização.

validate_only

bool

Se estiver definida, valida o pedido e pré-visualiza a CustomClass atualizada, mas não a atualiza efetivamente.

UpdatePhraseSetRequest

Mensagem de pedido para o método UpdatePhraseSet.

Campos
phrase_set

PhraseSet

Obrigatório. O PhraseSet a atualizar.

O campo name do PhraseSet é usado para identificar o PhraseSet a atualizar. Formato: projects/{project}/locations/{location}/phraseSets/{phrase_set}.

update_mask

FieldMask

A lista de campos a atualizar. Se estiver vazio, todos os campos com valores não predefinidos são considerados para atualização. Use * para atualizar todo o recurso PhraseSet.

validate_only

bool

Se estiver definida, valida o pedido e pré-visualiza o PhraseSet atualizado, mas não o atualiza efetivamente.

UpdateRecognizerRequest

Mensagem de pedido para o método UpdateRecognizer.

Campos
recognizer

Recognizer

Obrigatório. O Recognizer a atualizar.

O campo name do Recognizer é usado para identificar o Recognizer a atualizar. Formato: projects/{project}/locations/{location}/recognizers/{recognizer}.

update_mask

FieldMask

A lista de campos a atualizar. Se estiver vazio, todos os campos com valores não predefinidos são considerados para atualização. Use * para atualizar todo o recurso Recognizer.

validate_only

bool

Se estiver definida, valida o pedido e pré-visualiza o Recognizer atualizado, mas não o atualiza efetivamente.

VttOutputFileFormatConfig

Este tipo não tem campos.

Configurações de saída para o ficheiro de legendas no formato WebVTT.

WordInfo

Informações específicas de palavras para palavras reconhecidas.

Campos
start_offset

Duration

Desvio de tempo relativo ao início do áudio e correspondente ao início da palavra falada. Este campo só é definido se enable_word_time_offsets for true e apenas na hipótese principal. Esta é uma funcionalidade experimental e a precisão da diferença de tempo pode variar.

end_offset

Duration

Desvio de tempo relativo ao início do áudio e correspondente ao fim da palavra falada. Este campo só é definido se enable_word_time_offsets for true e apenas na hipótese principal. Esta é uma funcionalidade experimental e a precisão da diferença de tempo pode variar.

word

string

A palavra correspondente a este conjunto de informações.

confidence

float

A estimativa de confiança entre 0,0 e 1,0. Um número mais elevado indica uma probabilidade estimada maior de que as palavras reconhecidas estejam corretas. Este campo só é definido para a principal alternativa de um resultado sem streaming ou de um resultado de streaming em que is_final está definido como true. Não é garantido que este campo seja preciso e os utilizadores não devem confiar que é sempre fornecido. O valor predefinido de 0,0 é um valor de controlo que indica que confidence não foi definido.

speaker_label

string

É atribuída uma etiqueta distinta a cada interlocutor no áudio. Este campo especifica qual dos oradores foi detetado a ter dito esta palavra. speaker_label é definido se SpeakerDiarizationConfig for fornecido e apenas na alternativa principal.