Índice
Speech(interface)AccessMetadata(mensagem)AccessMetadata.ConstraintType(enum)AutoDetectDecodingConfig(mensagem)BatchRecognizeFileMetadata(mensagem)BatchRecognizeFileResult(mensagem)BatchRecognizeMetadata(mensagem)BatchRecognizeRequest(mensagem)BatchRecognizeRequest.ProcessingStrategy(enum)BatchRecognizeResponse(mensagem)BatchRecognizeResults(mensagem)BatchRecognizeTranscriptionMetadata(mensagem)CloudStorageResult(mensagem)Config(mensagem)CreateCustomClassRequest(mensagem)CreatePhraseSetRequest(mensagem)CreateRecognizerRequest(mensagem)CustomClass(mensagem)CustomClass.ClassItem(mensagem)CustomClass.State(enum)DeleteCustomClassRequest(mensagem)DeletePhraseSetRequest(mensagem)DeleteRecognizerRequest(mensagem)DenoiserConfig(mensagem)ExplicitDecodingConfig(mensagem)ExplicitDecodingConfig.AudioEncoding(enum)GcsOutputConfig(mensagem)GetConfigRequest(mensagem)GetCustomClassRequest(mensagem)GetPhraseSetRequest(mensagem)GetRecognizerRequest(mensagem)InlineOutputConfig(mensagem)InlineResult(mensagem)LanguageMetadata(mensagem)ListCustomClassesRequest(mensagem)ListCustomClassesResponse(mensagem)ListPhraseSetsRequest(mensagem)ListPhraseSetsResponse(mensagem)ListRecognizersRequest(mensagem)ListRecognizersResponse(mensagem)LocationsMetadata(mensagem)ModelFeature(mensagem)ModelFeatures(mensagem)ModelMetadata(mensagem)NativeOutputFileFormatConfig(mensagem)OperationMetadata(mensagem)OutputFormatConfig(mensagem)PhraseSet(mensagem)PhraseSet.Phrase(mensagem)PhraseSet.State(enum)RecognitionConfig(mensagem)RecognitionFeatures(mensagem)RecognitionFeatures.MultiChannelMode(enum)RecognitionOutputConfig(mensagem)RecognitionResponseMetadata(mensagem)RecognizeRequest(mensagem)RecognizeResponse(mensagem)Recognizer(mensagem)Recognizer.State(enum)SpeakerDiarizationConfig(mensagem)SpeechAdaptation(mensagem)SpeechAdaptation.AdaptationPhraseSet(mensagem)SpeechRecognitionAlternative(mensagem)SpeechRecognitionResult(mensagem)SrtOutputFileFormatConfig(mensagem)StreamingRecognitionConfig(mensagem)StreamingRecognitionFeatures(mensagem)StreamingRecognitionFeatures.VoiceActivityTimeout(mensagem)StreamingRecognitionResult(mensagem)StreamingRecognizeRequest(mensagem)StreamingRecognizeResponse(mensagem)StreamingRecognizeResponse.SpeechEventType(enum)TranscriptNormalization(mensagem)TranscriptNormalization.Entry(mensagem)TranslationConfig(mensagem)UndeleteCustomClassRequest(mensagem)UndeletePhraseSetRequest(mensagem)UndeleteRecognizerRequest(mensagem)UpdateConfigRequest(mensagem)UpdateCustomClassRequest(mensagem)UpdatePhraseSetRequest(mensagem)UpdateRecognizerRequest(mensagem)VttOutputFileFormatConfig(mensagem)WordInfo(mensagem)
Voz
Ativa a transcrição de voz e a gestão de recursos.
| BatchRecognize |
|---|
|
Executa o reconhecimento de voz assíncrono em lote: envia um pedido com N ficheiros de áudio e recebe uma operação de longa duração que pode ser consultada para ver quando as transcrições estão concluídas.
|
| CreateCustomClass |
|---|
|
Cria um
|
| CreatePhraseSet |
|---|
|
Cria um
|
| CreateRecognizer |
|---|
|
Cria um
|
| DeleteCustomClass |
|---|
|
Elimina o
|
| DeletePhraseSet |
|---|
|
Elimina o
|
| DeleteRecognizer |
|---|
|
Elimina o
|
| GetConfig |
|---|
|
Devolve o
|
| GetCustomClass |
|---|
|
Devolve o
|
| GetPhraseSet |
|---|
|
Devolve o
|
| GetRecognizer |
|---|
|
Devolve o
|
| ListCustomClasses |
|---|
|
Lista as classes personalizadas.
|
| ListPhraseSets |
|---|
|
Apresenta PhraseSets.
|
| ListRecognizers |
|---|
|
Identificadores de listas.
|
| Reconhece |
|---|
|
Realiza o reconhecimento de voz síncrono: recebe resultados depois de todo o áudio ter sido enviado e processado.
|
| StreamingRecognize |
|---|
|
Realiza o reconhecimento de voz em streaming bidirecional: recebe resultados enquanto envia áudio. Este método só está disponível através da API gRPC (não REST).
|
| UndeleteCustomClass |
|---|
|
Anula a eliminação de
|
| UndeletePhraseSet |
|---|
|
Anula a eliminação de
|
| UndeleteRecognizer |
|---|
|
Anula a eliminação de
|
| UpdateConfig |
|---|
|
Atualiza o
|
| UpdateCustomClass |
|---|
|
Atualiza o
|
| UpdatePhraseSet |
|---|
|
Atualiza o
|
| UpdateRecognizer |
|---|
|
Atualiza o
|
AccessMetadata
Os metadados de acesso de uma região específica. Isto pode ser aplicado se a política da organização para o projeto especificado não permitir uma região específica.
| Campos | |
|---|---|
constraint_type |
Descreve os diferentes tipos de restrições que são aplicadas. |
ConstraintType
Descreve os diferentes tipos de restrições que podem ser aplicadas numa região.
| Enumerações | |
|---|---|
CONSTRAINT_TYPE_UNSPECIFIED |
Restrição não especificada aplicada. |
RESOURCE_LOCATIONS_ORG_POLICY_CREATE_CONSTRAINT |
A política organizacional do projeto não permite a região especificada. |
AutoDetectDecodingConfig
Este tipo não tem campos.
Parâmetros de descodificação detetados automaticamente. Suportado para as seguintes codificações:
WAV_LINEAR16: amostras PCM de 16 bits com sinal little-endian num contentor WAV.
WAV_MULAW: amostras mulaw comprimidas de 8 bits num contentor WAV.
WAV_ALAW: amostras alaw comprimidas de 8 bits num contentor WAV.
RFC4867_5_AMR: frames AMR com um cabeçalho rfc4867.5.
RFC4867_5_AMRWB: frames AMR-WB com um cabeçalho rfc4867.5.
FLAC: frames FLAC no formato de contentor "FLAC nativo".
MP3: frames de áudio MPEG com metadados ID3 opcionais (ignorados).
OGG_OPUS: frames de áudio Opus num contentor Ogg.
WEBM_OPUS: frames de áudio Opus num contentor WebM.
MP4_AAC: frames de áudio AAC num contentor MP4.
M4A_AAC: frames de áudio AAC num contentor M4A.
MOV_AAC: frames de áudio AAC num contentor MOV.
BatchRecognizeFileMetadata
Metadados sobre um único ficheiro num lote para BatchRecognize.
| Campos | |
|---|---|
config |
Funcionalidades e metadados de áudio a usar para o reconhecimento de voz automático. Este campo, em combinação com o campo |
config_mask |
A lista de campos em |
Campo de união audio_source. A origem do áudio, que é um URI do Google Cloud Storage. audio_source só pode ser uma das seguintes opções: |
|
uri |
URI do Cloud Storage para o ficheiro de áudio. |
BatchRecognizeFileResult
Resultados finais para um único ficheiro.
| Campos | |
|---|---|
error |
Erro, se tiver sido encontrado um. |
metadata |
|
uri |
Descontinuado. Em alternativa, use |
transcript |
Descontinuado. Em alternativa, use |
Campo de união
|
|
cloud_storage_result |
Resultados do reconhecimento escritos no Cloud Storage. Este campo só é preenchido quando |
inline_result |
Resultados do reconhecimento. Este campo só é preenchido quando |
BatchRecognizeMetadata
Metadados da operação para BatchRecognize.
| Campos | |
|---|---|
transcription_metadata |
Mapeamento do nome do ficheiro fornecido para os metadados de transcrição desse ficheiro. |
BatchRecognizeRequest
Mensagem de pedido para o método BatchRecognize.
| Campos | |
|---|---|
recognizer |
Obrigatório. O nome do Recognizer a usar durante o reconhecimento. O formato esperado é |
config |
Funcionalidades e metadados de áudio a usar para o reconhecimento de voz automático. Este campo, em combinação com o campo |
config_mask |
A lista de campos em |
files[] |
Ficheiros de áudio com metadados de ficheiros para ASR. O número máximo de ficheiros que podem ser especificados é 15. |
recognition_output_config |
Opções de configuração para onde gerar as transcrições de cada ficheiro. |
processing_strategy |
Estratégia de processamento a usar para este pedido. |
ProcessingStrategy
Possíveis estratégias de processamento para pedidos em lote.
| Enumerações | |
|---|---|
PROCESSING_STRATEGY_UNSPECIFIED |
Valor predefinido para a estratégia de processamento. O pedido é processado assim que é recebido. |
DYNAMIC_BATCHING |
Se selecionada, processa o pedido durante períodos de utilização mais baixos para um desconto no preço. O pedido é processado no prazo de 24 horas. |
BatchRecognizeResponse
Mensagem de resposta para BatchRecognize que é incluída num Operation de execução prolongada.
| Campos | |
|---|---|
results |
Mapeamento do nome do ficheiro para o resultado final desse ficheiro. |
total_billed_duration |
Quando disponíveis, segundos de áudio faturados para o pedido correspondente. |
BatchRecognizeResults
Tipo de saída para o Cloud Storage das transcrições do BatchRecognize. Embora este proto não seja devolvido em nenhum lugar desta API, as transcrições do Cloud Storage são este proto serializado e devem ser analisadas como tal.
| Campos | |
|---|---|
results[] |
Lista sequencial de resultados da transcrição correspondentes a partes sequenciais do áudio. |
metadata |
Metadados sobre o reconhecimento. |
BatchRecognizeTranscriptionMetadata
Metadados sobre a transcrição de um único ficheiro (por exemplo, percentagem de progresso).
| Campos | |
|---|---|
progress_percent |
A quantidade do ficheiro que já foi transcrita. |
error |
Erro, se tiver sido encontrado um. |
uri |
O URI do Cloud Storage para o qual os resultados do reconhecimento vão ser escritos. |
CloudStorageResult
Resultados finais escritos no Cloud Storage.
| Campos | |
|---|---|
uri |
O URI do Cloud Storage para o qual os resultados do reconhecimento foram escritos. |
vtt_format_uri |
O URI do Cloud Storage para o qual os resultados do reconhecimento foram escritos como legendas formatadas VTT. Este campo é preenchido apenas quando é pedida a saída |
srt_format_uri |
O URI do Cloud Storage para o qual os resultados do reconhecimento foram escritos como legendas formatadas em SRT. Este campo é preenchido apenas quando é pedida a saída |
Configuração
Mensagem que representa a configuração da API Speech-to-Text. Isto inclui uma chave do KMS opcional com a qual os dados recebidos são encriptados.
| Campos | |
|---|---|
name |
Apenas saída. Identificador. O nome do recurso de configuração. Existe exatamente um recurso de configuração por projeto e por localização. O formato esperado é |
kms_key_name |
Opcional. Um nome da chave do KMS opcional que, se estiver presente, é usado para encriptar recursos de conversão de voz em texto em repouso. A atualização desta chave não encripta os recursos existentes que a usam. Apenas os novos recursos são encriptados com esta chave. O formato esperado é |
update_time |
Apenas saída. A hora mais recente em que este recurso foi modificado. |
CreateCustomClassRequest
Mensagem de pedido para o método CreateCustomClass.
| Campos | |
|---|---|
custom_class |
Obrigatório. O CustomClass a criar. |
validate_only |
Se estiver definido, valida o pedido e pré-visualiza o CustomClass, mas não o cria efetivamente. |
custom_class_id |
O ID a usar para a CustomClass, que se torna o componente final do nome do recurso da CustomClass. Este valor deve ter entre 4 e 63 carateres, e os carateres válidos são /[a-z][0-9]-/. |
parent |
Obrigatório. O projeto e a localização onde esta CustomClass vai ser criada. O formato esperado é |
CreatePhraseSetRequest
Mensagem de pedido para o método CreatePhraseSet.
| Campos | |
|---|---|
phrase_set |
Obrigatório. O PhraseSet a criar. |
validate_only |
Se estiver definido, valida o pedido e pré-visualiza o PhraseSet, mas não o cria efetivamente. |
phrase_set_id |
O ID a usar para o PhraseSet, que se torna o componente final do nome do recurso do PhraseSet. Este valor deve ter entre 4 e 63 carateres, e os carateres válidos são /[a-z][0-9]-/. |
parent |
Obrigatório. O projeto e a localização onde este PhraseSet vai ser criado. O formato esperado é |
CreateRecognizerRequest
Mensagem de pedido para o método CreateRecognizer.
| Campos | |
|---|---|
recognizer |
Obrigatório. O Recognizer a criar. |
validate_only |
Se estiver definido, valida o pedido e pré-visualiza o Recognizer, mas não o cria efetivamente. |
recognizer_id |
O ID a usar para o Recognizer, que se torna o componente final do nome do recurso do Recognizer. Este valor deve ter entre 4 e 63 carateres, e os carateres válidos são /[a-z][0-9]-/. |
parent |
Obrigatório. O projeto e a localização onde este Recognizer vai ser criado. O formato esperado é |
CustomClass
CustomClass para a definição de preferências no reconhecimento de voz. Usado para definir um conjunto de palavras ou expressões que representam um conceito ou um tema comum que é provável que apareça no seu áudio, por exemplo, uma lista de nomes de navios de passageiros.
| Campos | |
|---|---|
name |
Apenas saída. Identificador. O nome do recurso da CustomClass. Formato: |
uid |
Apenas saída. Identificador exclusivo atribuído pelo sistema para o CustomClass. |
display_name |
Opcional. Nome legível e configurável pelo utilizador para a CustomClass. Tem de ter 63 carateres ou menos. |
items[] |
Uma coleção de itens de classe. |
state |
Apenas saída. O estado do ciclo de vida de CustomClass. |
create_time |
Apenas saída. Hora de criação. |
update_time |
Apenas saída. A hora mais recente em que este recurso foi modificado. |
delete_time |
Apenas saída. A hora em que este recurso foi pedido para eliminação. |
expire_time |
Apenas saída. A hora em que este recurso vai ser anulado. |
annotations |
Opcional. Permite que os utilizadores armazenem pequenas quantidades de dados arbitrários. Tanto a chave como o valor têm de ter, no máximo, 63 carateres. No máximo, 100 anotações. |
etag |
Apenas saída. Esta soma de verificação é calculada pelo servidor com base no valor de outros campos. Isto pode ser enviado em pedidos de atualização, anulação da eliminação e eliminação para garantir que o cliente tem um valor atualizado antes de continuar. |
reconciling |
Apenas saída. Indica se esta CustomClass está ou não em processo de atualização. |
kms_key_name |
Apenas saída. O nome da chave do KMS com a qual a CustomClass está encriptada. O formato esperado é |
kms_key_version_name |
Apenas saída. O nome da versão da chave do KMS com a qual a CustomClass está encriptada. O formato esperado é |
ClassItem
Um item da classe.
| Campos | |
|---|---|
value |
O valor do artigo da classe. |
Estado
Conjunto de estados que definem o ciclo de vida de uma CustomClass.
| Enumerações | |
|---|---|
STATE_UNSPECIFIED |
Estado não especificado. Isto só é usado/útil para distinguir valores não definidos. |
ACTIVE |
O estado normal e ativo. |
DELETED |
Esta CustomClass foi eliminada. |
DeleteCustomClassRequest
Mensagem de pedido para o método DeleteCustomClass.
| Campos | |
|---|---|
name |
Obrigatório. O nome da CustomClass a eliminar. Formato: |
validate_only |
Se estiver definido, valida o pedido e pré-visualiza a CustomClass eliminada, mas não a elimina efetivamente. |
allow_missing |
Se for definida como verdadeira e a CustomClass não for encontrada, o pedido é bem-sucedido e não é realizada nenhuma operação (neste caso, não é registada nenhuma operação). |
etag |
Esta soma de verificação é calculada pelo servidor com base no valor de outros campos. Isto pode ser enviado em pedidos de atualização, anulação da eliminação e eliminação para garantir que o cliente tem um valor atualizado antes de continuar. |
DeletePhraseSetRequest
Mensagem de pedido para o método DeletePhraseSet.
| Campos | |
|---|---|
name |
Obrigatório. O nome do PhraseSet a eliminar. Formato: |
validate_only |
Se definido, valida o pedido e pré-visualiza o PhraseSet eliminado, mas não o elimina efetivamente. |
allow_missing |
Se estiver definida como verdadeira e o PhraseSet não for encontrado, o pedido é bem-sucedido e não é realizada nenhuma operação (neste caso, não é registada nenhuma operação). |
etag |
Esta soma de verificação é calculada pelo servidor com base no valor de outros campos. Isto pode ser enviado em pedidos de atualização, anulação da eliminação e eliminação para garantir que o cliente tem um valor atualizado antes de continuar. |
DeleteRecognizerRequest
Mensagem de pedido para o método DeleteRecognizer.
| Campos | |
|---|---|
name |
Obrigatório. O nome do identificador a eliminar. Formato: |
validate_only |
Se estiver definido, valida o pedido e pré-visualiza o Recognizer eliminado, mas não o elimina efetivamente. |
allow_missing |
Se estiver definido como verdadeiro e o Recognizer não for encontrado, o pedido é bem-sucedido e não é realizada nenhuma operação (neste caso, não é registada nenhuma operação). |
etag |
Esta soma de verificação é calculada pelo servidor com base no valor de outros campos. Isto pode ser enviado em pedidos de atualização, anulação da eliminação e eliminação para garantir que o cliente tem um valor atualizado antes de continuar. |
DenoiserConfig
Configuração do redutor de ruído. Pode não ser compatível com todos os modelos e pode não ter efeito.
| Campos | |
|---|---|
denoise_audio |
Remover o ruído do áudio antes de o enviar para o modelo de transcrição. |
snr_threshold |
Limite da relação sinal/ruído (SNR) para o redutor de ruído. Aqui, a SNR significa o volume do sinal de voz. O áudio com uma SNR abaixo deste limite, o que significa que a voz está demasiado baixa, não é enviado para o modelo de transcrição. Se snr_threshold=0, não é aplicado nenhum filtro. |
ExplicitDecodingConfig
Parâmetros de descodificação especificados explicitamente.
| Campos | |
|---|---|
encoding |
Obrigatório. Codificação dos dados de áudio enviados para reconhecimento. |
sample_rate_hertz |
Opcional. Taxa de amostragem em Hertz dos dados de áudio enviados para reconhecimento. Os valores válidos são: 8000 a 48 000, sendo 16 000 o valor ideal. Para os melhores resultados, defina a taxa de amostragem da fonte de áudio para 16 000 Hz. Se tal não for possível, use a taxa de amostragem nativa da fonte de áudio (em vez de reamostragem). Tenha em atenção que este campo está marcado como OPCIONAL por motivos de retrocompatibilidade. É (e sempre foi) efetivamente OBRIGATÓRIO. |
audio_channel_count |
Opcional. Número de canais presentes nos dados de áudio enviados para reconhecimento. Tenha em atenção que este campo está marcado como OPCIONAL por motivos de retrocompatibilidade. É (e sempre foi) efetivamente OBRIGATÓRIO. O valor máximo permitido é 8. |
AudioEncoding
Codificações de dados de áudio suportadas.
| Enumerações | |
|---|---|
AUDIO_ENCODING_UNSPECIFIED |
Valor predefinido. Este valor não é usado. |
LINEAR16 |
Amostras PCM de 16 bits assinadas little-endian sem cabeçalho. |
MULAW |
Exemplos de mulaw comprimidos de 8 bits sem cabeçalho. |
ALAW |
Exemplos de alaw comprimido de 8 bits sem cabeçalho. |
AMR |
Frames AMR com um cabeçalho rfc4867.5. |
AMR_WB |
Frames AMR-WB com um cabeçalho rfc4867.5. |
FLAC |
Frames FLAC no formato de contentor "FLAC nativo". |
MP3 |
Frames de áudio MPEG com metadados ID3 opcionais (ignorados). |
OGG_OPUS |
Frames de áudio Opus num contentor Ogg. |
WEBM_OPUS |
Frames de áudio Opus num contentor WebM. |
MP4_AAC |
Frames de áudio AAC num contentor MP4. |
M4A_AAC |
Frames de áudio AAC num contentor M4A. |
MOV_AAC |
Frames de áudio AAC num contentor MOV. |
GcsOutputConfig
Configurações de saída para o Cloud Storage.
| Campos | |
|---|---|
uri |
O prefixo do URI do Cloud Storage com o qual os resultados do reconhecimento vão ser escritos. |
GetConfigRequest
Mensagem de pedido para o método GetConfig.
| Campos | |
|---|---|
name |
Obrigatório. O nome da configuração a obter. Existe exatamente um recurso de configuração por projeto e por localização. O formato esperado é |
GetCustomClassRequest
Mensagem de pedido para o método GetCustomClass.
| Campos | |
|---|---|
name |
Obrigatório. O nome da CustomClass a obter. O formato esperado é |
GetPhraseSetRequest
Mensagem de pedido para o método GetPhraseSet.
| Campos | |
|---|---|
name |
Obrigatório. O nome do PhraseSet a obter. O formato esperado é |
GetRecognizerRequest
Mensagem de pedido para o método GetRecognizer.
| Campos | |
|---|---|
name |
Obrigatório. O nome do Recognizer a obter. O formato esperado é |
InlineOutputConfig
Este tipo não tem campos.
Configurações de saída para resposta inline.
InlineResult
Resultados finais devolvidos inline na resposta de reconhecimento.
| Campos | |
|---|---|
transcript |
A transcrição do ficheiro de áudio. |
vtt_captions |
A transcrição do ficheiro de áudio como legendas formatadas em VTT. Este campo é preenchido apenas quando é pedida a saída |
srt_captions |
A transcrição do ficheiro de áudio como legendas formatadas em SRT. Este campo é preenchido apenas quando é pedida a saída |
LanguageMetadata
Os metadados sobre os locais disponíveis numa determinada região. Atualmente, estes são apenas os modelos disponíveis para cada localidade
| Campos | |
|---|---|
models |
Mapeamento de local (código de idioma) -> modelos |
ListCustomClassesRequest
Mensagem de pedido para o método ListCustomClasses.
| Campos | |
|---|---|
parent |
Obrigatório. O projeto e a localização dos recursos CustomClass a apresentar. O formato esperado é |
page_size |
Número de resultados por pedido. Um page_size válido varia entre 0 e 100, inclusive. Se o page_size for zero ou não especificado, é escolhido um tamanho de página de 5. Se o tamanho da página exceder 100, é reduzido para 100. Tenha em atenção que uma chamada pode devolver menos resultados do que o tamanho da página pedido. |
page_token |
Um token de página, recebido de uma chamada Quando paginar, todos os outros parâmetros fornecidos a |
show_deleted |
Se devem ou não ser apresentados os recursos que foram eliminados. |
ListCustomClassesResponse
Mensagem de resposta para o método ListCustomClasses.
| Campos | |
|---|---|
custom_classes[] |
A lista de CustomClasses pedidas. |
next_page_token |
Um token que pode ser enviado como |
ListPhraseSetsRequest
Mensagem de pedido para o método ListPhraseSets.
| Campos | |
|---|---|
parent |
Obrigatório. O projeto e a localização dos recursos PhraseSet a listar. O formato esperado é |
page_size |
O número máximo de PhraseSets a devolver. O serviço pode devolver um número inferior a este valor. Se não for especificado, são devolvidos, no máximo, 5 PhraseSets. O valor máximo é 100. Os valores superiores a 100 são forçados a 100. |
page_token |
Um token de página, recebido de uma chamada Quando paginar, todos os outros parâmetros fornecidos a |
show_deleted |
Se devem ou não ser apresentados os recursos que foram eliminados. |
ListPhraseSetsResponse
Mensagem de resposta para o método ListPhraseSets.
| Campos | |
|---|---|
phrase_sets[] |
A lista de PhraseSets pedidos. |
next_page_token |
Um token que pode ser enviado como |
ListRecognizersRequest
Mensagem de pedido para o método ListRecognizers.
| Campos | |
|---|---|
parent |
Obrigatório. O projeto e a localização dos reconhecedores a listar. O formato esperado é |
page_size |
O número máximo de Recognizers a devolver. O serviço pode devolver um número inferior a este valor. Se não for especificado, são devolvidos, no máximo, 5 Recognizers. O valor máximo é 100. Os valores superiores a 100 são forçados a 100. |
page_token |
Um token de página, recebido de uma chamada Quando paginar, todos os outros parâmetros fornecidos a |
show_deleted |
Se devem ou não ser apresentados os recursos que foram eliminados. |
ListRecognizersResponse
Mensagem de resposta para o método ListRecognizers.
| Campos | |
|---|---|
recognizers[] |
A lista de reconhecedores pedidos. |
next_page_token |
Um token que pode ser enviado como |
LocationsMetadata
Metadados principais para a API Locations para STT V2. Atualmente, trata-se apenas dos metadados sobre locais, modelos e funcionalidades
| Campos | |
|---|---|
languages |
Informações sobre os locais, os modelos e as funcionalidades disponíveis representados na estrutura hierárquica de locais -> modelos -> funcionalidades |
access_metadata |
Informações sobre os metadados de acesso para a região e o projeto especificados. |
ModelFeature
Representa uma funcionalidade singular de um modelo. Se a funcionalidade for recognizer, o release_state da funcionalidade representa o release_state do modelo
| Campos | |
|---|---|
feature |
O nome da funcionalidade (nota: a funcionalidade pode ser |
release_state |
O estado de lançamento da funcionalidade |
ModelFeatures
Representa a coleção de funcionalidades pertencentes a um modelo
| Campos | |
|---|---|
model_feature[] |
Campo repetido que contém todas as funcionalidades do modelo |
ModelMetadata
Os metadados sobre os modelos numa determinada região para um local específico. Atualmente, estas são apenas as funcionalidades do modelo
| Campos | |
|---|---|
model_features |
Mapeamento do nome do modelo -> funcionalidades desse modelo |
NativeOutputFileFormatConfig
Este tipo não tem campos.
Configurações de saída para protos BatchRecognizeResults serializados.
OperationMetadata
Representa os metadados de uma operação de longa duração.
| Campos | |
|---|---|
create_time |
A hora em que a operação foi criada. |
update_time |
A hora da última atualização da operação. |
resource |
O caminho do recurso para o destino da operação. |
method |
O método que acionou a operação. |
kms_key_name |
O nome da chave do KMS com a qual o conteúdo da operação está encriptado. O formato esperado é |
kms_key_version_name |
O nome da versão da chave do KMS com a qual o conteúdo da operação é encriptado. O formato esperado é |
progress_percent |
A percentagem de progresso da operação. Os valores podem variar entre 0 e 100. Se o valor for 100, a operação está concluída. |
Campo de união request. O pedido que gerou a operação. request só pode ser uma das seguintes opções: |
|
batch_recognize_request |
O BatchRecognizeRequest que gerou a operação. |
create_recognizer_request |
O CreateRecognizerRequest que gerou a operação. |
update_recognizer_request |
O UpdateRecognizerRequest que gerou a operação. |
delete_recognizer_request |
O DeleteRecognizerRequest que gerou a operação. |
undelete_recognizer_request |
O UndeleteRecognizerRequest que gerou a operação. |
create_custom_class_request |
O CreateCustomClassRequest que gerou a operação. |
update_custom_class_request |
O UpdateCustomClassRequest que gerou a operação. |
delete_custom_class_request |
O DeleteCustomClassRequest que gerou a operação. |
undelete_custom_class_request |
O UndeleteCustomClassRequest que gerou a operação. |
create_phrase_set_request |
O CreatePhraseSetRequest que gerou a operação. |
update_phrase_set_request |
O UpdatePhraseSetRequest que gerou a operação. |
delete_phrase_set_request |
O DeletePhraseSetRequest que gerou a operação. |
undelete_phrase_set_request |
O UndeletePhraseSetRequest que gerou a operação. |
update_config_request |
O UpdateConfigRequest que gerou a operação. |
Campo de união metadata. Metadados específicos por RPC. metadata só pode ser uma das seguintes opções: |
|
batch_recognize_metadata |
Metadados específicos do método BatchRecognize. |
OutputFormatConfig
Configuração do formato dos resultados armazenados em output.
| Campos | |
|---|---|
native |
Configuração para o formato de saída nativo. Se este campo estiver definido ou se nenhum outro campo de formato de saída estiver definido, as transcrições são escritas no destino no formato nativo. |
vtt |
Configuração para o formato de saída VTT. Se este campo estiver definido, as transcrições são escritas no destino no formato VTT. |
srt |
Configuração para o formato de saída SRT. Se este campo estiver definido, as transcrições são escritas no destino no formato SRT. |
PhraseSet
PhraseSet para a definição de preferências no reconhecimento de voz. Um PhraseSet é usado para fornecer "sugestões" ao reconhecedor de voz para favorecer palavras e expressões específicas nos resultados.
| Campos | |
|---|---|
name |
Apenas saída. Identificador. O nome do recurso do PhraseSet. Formato: |
uid |
Apenas saída. Identificador exclusivo atribuído pelo sistema para o PhraseSet. |
phrases[] |
Uma lista de palavras e expressões. |
boost |
Hint Boost. Um valor positivo aumenta a probabilidade de uma expressão específica ser reconhecida em detrimento de outras expressões com um som semelhante. Quanto maior for o aumento, maior é a probabilidade de reconhecimento de falsos positivos. Os valores |
display_name |
Nome legível definido pelo utilizador para o PhraseSet. Tem de ter 63 carateres ou menos. |
state |
Apenas saída. O estado do ciclo de vida do PhraseSet. |
create_time |
Apenas saída. Hora de criação. |
update_time |
Apenas saída. A hora mais recente em que este recurso foi modificado. |
delete_time |
Apenas saída. A hora em que este recurso foi pedido para eliminação. |
expire_time |
Apenas saída. A hora em que este recurso vai ser anulado. |
annotations |
Permite que os utilizadores armazenem pequenas quantidades de dados arbitrários. Tanto a chave como o valor têm de ter, no máximo, 63 carateres. No máximo, 100 anotações. |
etag |
Apenas saída. Esta soma de verificação é calculada pelo servidor com base no valor de outros campos. Isto pode ser enviado em pedidos de atualização, anulação da eliminação e eliminação para garantir que o cliente tem um valor atualizado antes de continuar. |
reconciling |
Apenas saída. Indica se este PhraseSet está ou não em processo de atualização. |
kms_key_name |
Apenas saída. O nome da chave do KMS com a qual o PhraseSet está encriptado. O formato esperado é |
kms_key_version_name |
Apenas saída. O nome da versão da chave do KMS com a qual o PhraseSet está encriptado. O formato esperado é |
Expressão
Uma expressão contém palavras e "sugestões" de expressões para que o reconhecimento de voz tenha maior probabilidade de as reconhecer. Isto pode ser usado para melhorar a precisão de palavras e expressões específicas, por exemplo, se comandos específicos forem normalmente falados pelo utilizador. Também pode usar esta funcionalidade para adicionar palavras adicionais ao vocabulário do reconhecedor.
Os itens da lista também podem incluir referências CustomClass que contêm grupos de palavras que representam conceitos comuns que ocorrem na linguagem natural.
| Campos | |
|---|---|
value |
A própria expressão. |
boost |
Hint Boost. Substitui o aumento definido ao nível do conjunto de expressões. Um valor positivo aumenta a probabilidade de uma expressão específica ser reconhecida em detrimento de outras expressões com um som semelhante. Quanto maior for o aumento, maior é a probabilidade de reconhecimento de falsos positivos. Os valores de aumento negativos correspondem à eliminação de parcialidade. A eliminação de parcialidades não está ativada, pelo que os valores de aumento negativos devolvem um erro. Os valores de aumento têm de estar entre 0 e 20. Quaisquer valores fora desse intervalo devolvem um erro. Recomendamos que use uma abordagem de pesquisa binária para encontrar o valor ideal para o seu exemplo de utilização, bem como adicionar expressões com e sem aumento aos seus pedidos. |
Estado
Conjunto de estados que definem o ciclo de vida de um PhraseSet.
| Enumerações | |
|---|---|
STATE_UNSPECIFIED |
Estado não especificado. Isto só é usado/útil para distinguir valores não definidos. |
ACTIVE |
O estado normal e ativo. |
DELETED |
Este PhraseSet foi eliminado. |
RecognitionConfig
Fornece informações ao Recognizer que especificam como processar o pedido de reconhecimento.
| Campos | |
|---|---|
model |
Opcional. Que modelo usar para pedidos de reconhecimento. Selecione o modelo mais adequado ao seu domínio para obter os melhores resultados. Pode encontrar orientações para escolher o modelo a usar na documentação dos modelos de transcrição, e os modelos suportados em cada região podem ser encontrados na tabela de modelos suportados. |
language_codes[] |
Opcional. O idioma do áudio fornecido como uma etiqueta de idioma BCP-47. As etiquetas de idioma são normalizadas para BCP-47 antes de serem usadas. Por exemplo, "en-us" torna-se "en-US". Os idiomas suportados para cada modelo estão indicados na tabela de modelos suportados. Se forem fornecidos idiomas adicionais, o resultado do reconhecimento contém o reconhecimento no idioma mais provável detetado. O resultado do reconhecimento inclui a etiqueta de idioma do idioma detetado no áudio. |
features |
Funcionalidades de reconhecimento de voz a ativar. |
adaptation |
Contexto de adaptação da voz que pondera as previsões do reconhecedor para palavras e expressões específicas. |
transcript_normalization |
Opcional. Use a normalização da transcrição para substituir automaticamente partes da transcrição por expressões à sua escolha. Para o StreamingRecognize, esta normalização aplica-se apenas a transcrições parciais estáveis (estabilidade > 0,8) e transcrições finais. |
translation_config |
Opcional. Configuração opcional usada para executar automaticamente a tradução no áudio fornecido para o idioma desejado para modelos suportados. |
denoiser_config |
Opcional. Configuração opcional do cancelamento de ruído. Pode não ser compatível com todos os modelos e pode não ter efeito. |
Campo de união decoding_config. Parâmetros de descodificação do áudio enviado para reconhecimento. decoding_config só pode ser uma das seguintes opções: |
|
auto_decoding_config |
Detetar automaticamente os parâmetros de descodificação. Preferível para formatos suportados. |
explicit_decoding_config |
Parâmetros de descodificação especificados explicitamente. Obrigatório se usar áudio PCM sem cabeçalho (linear16, mulaw, alaw). |
RecognitionFeatures
Funcionalidades de reconhecimento disponíveis.
| Campos | |
|---|---|
profanity_filter |
Se estiver definido como |
enable_word_time_offsets |
Se |
enable_word_confidence |
Se |
enable_automatic_punctuation |
Se |
enable_spoken_punctuation |
O comportamento da pontuação falada para a chamada. Se |
enable_spoken_emojis |
O comportamento dos emojis falados para a chamada. Se |
multi_channel_mode |
Modo para reconhecer áudio multicanal. |
diarization_config |
Configuração para ativar a separação de oradores. Para ativar a separação de oradores, defina este campo para uma mensagem SpeakerDiarizationConfig vazia. |
max_alternatives |
Número máximo de hipóteses de reconhecimento a devolver. O servidor pode devolver menos de |
MultiChannelMode
Opções para reconhecer áudio multicanal.
| Enumerações | |
|---|---|
MULTI_CHANNEL_MODE_UNSPECIFIED |
Valor predefinido para o modo multicanal. Se o áudio contiver vários canais, apenas o primeiro canal é transcrito. Os outros canais são ignorados. |
SEPARATE_RECOGNITION_PER_CHANNEL |
Se esta opção for selecionada, cada canal no áudio fornecido é transcrito de forma independente. Não é possível selecionar esta opção se o model selecionado for latest_short. |
RecognitionOutputConfig
Opções de configuração para as saídas do reconhecimento.
| Campos | |
|---|---|
output_format_config |
Opcional. Configuração do formato dos resultados armazenados em |
Campo de união
|
|
gcs_output_config |
Se esta mensagem estiver preenchida, os resultados do reconhecimento são escritos no URI do Google Cloud Storage fornecido. |
inline_response_config |
Se esta mensagem estiver preenchida, os resultados do reconhecimento são fornecidos na mensagem |
RecognitionResponseMetadata
Metadados sobre o pedido e a resposta de reconhecimento.
| Campos | |
|---|---|
request_id |
Identificador de pedido global gerado automaticamente pela API. |
total_billed_duration |
Quando disponíveis, segundos de áudio faturados para o pedido correspondente. |
RecognizeRequest
Mensagem de pedido para o método Recognize. Tem de fornecer content ou uri. O fornecimento de ambas ou nenhuma das informações devolve INVALID_ARGUMENT. Consulte os limites de conteúdo.
| Campos | |
|---|---|
recognizer |
Obrigatório. O nome do Recognizer a usar durante o reconhecimento. O formato esperado é |
config |
Funcionalidades e metadados de áudio a usar para o reconhecimento de voz automático. Este campo, em combinação com o campo |
config_mask |
A lista de campos em |
Campo de união audio_source. A origem de áudio, que é conteúdo inline ou um URI do Google Cloud Storage. audio_source só pode ser uma das seguintes opções: |
|
content |
Os bytes de dados de áudio codificados conforme especificado em |
uri |
URI que aponta para um ficheiro que contém bytes de dados de áudio, conforme especificado em |
RecognizeResponse
Mensagem de resposta para o método Recognize.
| Campos | |
|---|---|
results[] |
Lista sequencial de resultados da transcrição correspondentes a partes sequenciais do áudio. |
metadata |
Metadados sobre o reconhecimento. |
Reconhecedor
Uma mensagem do Recognizer. Armazena a configuração e os metadados do reconhecimento.
| Campos | |
|---|---|
name |
Apenas saída. Identificador. O nome do recurso do Recognizer. Formato: |
uid |
Apenas saída. Identificador exclusivo atribuído pelo sistema para o Recognizer. |
display_name |
Nome legível e definível pelo utilizador para o Recognizer. Tem de ter 63 carateres ou menos. |
model |
Opcional. Este campo foi descontinuado. Prefira o campo Que modelo usar para pedidos de reconhecimento. Selecione o modelo mais adequado ao seu domínio para obter os melhores resultados. Pode encontrar orientações para escolher o modelo a usar na documentação dos modelos de transcrição, e os modelos suportados em cada região podem ser encontrados na tabela de modelos suportados. |
language_codes[] |
Opcional. Este campo foi descontinuado. Prefira o campo O idioma do áudio fornecido como uma etiqueta de idioma BCP-47. Os idiomas suportados para cada modelo estão indicados na tabela de modelos suportados. Se forem fornecidos idiomas adicionais, o resultado do reconhecimento contém o reconhecimento no idioma mais provável detetado. O resultado do reconhecimento inclui a etiqueta de idioma do idioma detetado no áudio. Quando cria ou atualiza um Recognizer, estes valores são armazenados no formato BCP-47 normalizado. Por exemplo, "en-us" é armazenado como "en-US". |
default_recognition_config |
Configuração predefinida a usar para pedidos com este Recognizer. Isto pode ser substituído pela configuração inline no campo |
annotations |
Permite que os utilizadores armazenem pequenas quantidades de dados arbitrários. Tanto a chave como o valor têm de ter, no máximo, 63 carateres. No máximo, 100 anotações. |
state |
Apenas saída. O estado do ciclo de vida do Recognizer. |
create_time |
Apenas saída. Hora de criação. |
update_time |
Apenas saída. A hora mais recente em que este Recognizer foi modificado. |
delete_time |
Apenas saída. A hora em que este Recognizer foi pedido para eliminação. |
expire_time |
Apenas saída. A hora em que este Recognizer vai ser removido completamente. |
etag |
Apenas saída. Esta soma de verificação é calculada pelo servidor com base no valor de outros campos. Isto pode ser enviado em pedidos de atualização, anulação da eliminação e eliminação para garantir que o cliente tem um valor atualizado antes de continuar. |
reconciling |
Apenas saída. Indica se este Recognizer está ou não em processo de atualização. |
kms_key_name |
Apenas saída. O nome da chave do KMS com a qual o Recognizer está encriptado. O formato esperado é |
kms_key_version_name |
Apenas saída. O nome da versão da chave do KMS com a qual o Recognizer está encriptado. O formato esperado é |
Estado
Conjunto de estados que definem o ciclo de vida de um Recognizer.
| Enumerações | |
|---|---|
STATE_UNSPECIFIED |
O valor predefinido. Este valor é usado se o estado for omitido. |
ACTIVE |
O Recognizer está ativo e pronto a ser usado. |
DELETED |
Este identificador foi eliminado. |
SpeakerDiarizationConfig
Configuração para ativar a separação de oradores.
| Campos | |
|---|---|
min_speaker_count |
Opcional. O sistema determina automaticamente o número de oradores. Este valor não é usado atualmente. |
max_speaker_count |
Opcional. O sistema determina automaticamente o número de oradores. Este valor não é usado atualmente. |
SpeechAdaptation
Fornece "sugestões" ao reconhecedor de voz para favorecer palavras e expressões específicas nos resultados. Os PhraseSets podem ser especificados como um recurso inline ou uma referência a um recurso PhraseSet existente.
| Campos | |
|---|---|
phrase_sets[] |
Uma lista de PhraseSets inline ou referenciados. |
custom_classes[] |
Uma lista de CustomClasses inline. Os recursos CustomClass existentes podem ser referenciados diretamente num PhraseSet. |
AdaptationPhraseSet
Um PhraseSet de parcialidade, que pode ser uma string que faz referência ao nome de um recurso PhraseSets existente ou uma definição inline de um PhraseSet.
| Campos | |
|---|---|
Campo de união
|
|
phrase_set |
O nome de um recurso PhraseSet existente. O utilizador tem de ter acesso de leitura ao recurso e este não pode ser eliminado. |
inline_phrase_set |
Um PhraseSet definido inline. |
SpeechRecognitionAlternative
Hipóteses alternativas (também conhecidas como lista n-best).
| Campos | |
|---|---|
transcript |
Texto da transcrição que representa as palavras que o utilizador disse. |
confidence |
A estimativa de confiança entre 0,0 e 1,0. Um número mais elevado indica uma probabilidade estimada maior de que as palavras reconhecidas estejam corretas. Este campo só é definido para a principal alternativa de um resultado sem streaming ou de um resultado de streaming em que |
words[] |
Uma lista de informações específicas de palavras para cada palavra reconhecida. Quando o |
SpeechRecognitionResult
Um resultado de reconhecimento de voz correspondente a uma parte do áudio.
| Campos | |
|---|---|
alternatives[] |
Pode conter uma ou mais hipóteses de reconhecimento. Estas alternativas são ordenadas em termos de precisão, sendo a alternativa superior (primeira) a mais provável, de acordo com a classificação do reconhecedor. |
channel_tag |
Para áudio multicanal, este é o número do canal correspondente ao resultado reconhecido para o áudio desse canal. Para |
result_end_offset |
Desvio de tempo do fim deste resultado relativamente ao início do áudio. |
language_code |
Apenas saída. A etiqueta de idioma BCP-47 do idioma neste resultado. Este código de idioma foi detetado como o mais provável de ser falado no áudio. |
SrtOutputFileFormatConfig
Este tipo não tem campos.
Configurações de saída de um ficheiro de legendas formatado em texto SubRip.
StreamingRecognitionConfig
Fornece informações de configuração para o pedido StreamingRecognize.
| Campos | |
|---|---|
config |
Obrigatório. Funcionalidades e metadados de áudio a usar para o reconhecimento de voz automático. Este campo, em combinação com o campo |
config_mask |
A lista de campos em |
streaming_features |
Funcionalidades de reconhecimento de voz para ativar especificamente pedidos de reconhecimento de áudio em streaming. |
StreamingRecognitionFeatures
Funcionalidades de reconhecimento disponíveis específicas para pedidos de reconhecimento de streaming.
| Campos | |
|---|---|
enable_voice_activity_events |
Se |
interim_results |
Se deve ou não transmitir resultados provisórios ao cliente. Se estiver definida como verdadeira, os resultados provisórios são transmitidos para o cliente. Caso contrário, apenas a resposta final é transmitida em fluxo contínuo. |
voice_activity_timeout |
Se estiver definido, o servidor fecha automaticamente a stream após a duração especificada decorrida após o envio do último evento de voz VOICE_ACTIVITY. O campo |
VoiceActivityTimeout
Eventos nos quais é possível definir um limite de tempo para a atividade de voz.
| Campos | |
|---|---|
speech_start_timeout |
Duração do limite de tempo da stream se não for iniciada nenhuma fala. Se esta opção estiver definida e não for detetada voz durante este período no início da stream, o servidor fecha a stream. |
speech_end_timeout |
Duração da pausa da stream após o fim da fala. Se esta opção estiver definida e não for detetada voz durante este período após a deteção de voz, o servidor fecha a stream. |
StreamingRecognitionResult
Um resultado de reconhecimento de voz de streaming correspondente a uma parte do áudio que está a ser processada atualmente.
| Campos | |
|---|---|
alternatives[] |
Pode conter uma ou mais hipóteses de reconhecimento. Estas alternativas são ordenadas em termos de precisão, sendo a alternativa superior (primeira) a mais provável, de acordo com a classificação do reconhecedor. |
is_final |
Se |
stability |
Uma estimativa da probabilidade de o reconhecedor não alterar a sua suposição sobre este resultado provisório. Os valores variam entre 0,0 (completamente instável) e 1,0 (completamente estável). Este campo só é fornecido para resultados provisórios ( |
result_end_offset |
Desvio de tempo do fim deste resultado relativamente ao início do áudio. |
channel_tag |
Para áudio multicanal, este é o número do canal correspondente ao resultado reconhecido para o áudio desse canal. Para |
language_code |
Apenas saída. A etiqueta de idioma BCP-47 do idioma neste resultado. Este código de idioma foi detetado como o mais provável de ser falado no áudio. |
StreamingRecognizeRequest
Mensagem de pedido para o método StreamingRecognize. São enviadas várias mensagens StreamingRecognizeRequest numa chamada.
Se o Recognizer referenciado por recognizer contiver uma configuração de pedido totalmente especificada, a stream só pode conter mensagens com apenas audio definido.
Caso contrário, a primeira mensagem tem de conter uma mensagem recognizer e uma mensagem streaming_config que, em conjunto, especifiquem totalmente a configuração do pedido e não podem conter audio. Todas as mensagens subsequentes só podem ter o elemento audio definido.
| Campos | |
|---|---|
recognizer |
Obrigatório. O nome do Recognizer a usar durante o reconhecimento. O formato esperado é |
Campo de união
|
|
streaming_config |
StreamingRecognitionConfig a usar nesta tentativa de reconhecimento. Se for fornecido, substitui o RecognitionConfig predefinido armazenado no Recognizer. |
audio |
Bytes de áudio inline a serem reconhecidos. O tamanho máximo deste campo é de 15 KB por pedido. |
StreamingRecognizeResponse
StreamingRecognizeResponse é a única mensagem devolvida ao cliente por StreamingRecognize. Uma série de zero ou mais mensagens StreamingRecognizeResponse são transmitidas de volta ao cliente. Se não houver áudio reconhecível, não são transmitidas mensagens de volta para o cliente.
Seguem-se alguns exemplos de StreamingRecognizeResponses que podem ser devolvidos durante o processamento de áudio:
results { alternatives { transcript: "tube" } stability: 0.01 }
results { alternatives { transcript: "to be a" } stability: 0.01 }
results { alternatives { transcript: "to be" } stability: 0.9 } results { alternatives { transcript: " or not to be" } stability: 0.01 }
results { alternatives { transcript: "to be or not to be" confidence: 0.92 } alternatives { transcript: "to bee or not to bee" } is_final: true }
results { alternatives { transcript: " that's" } stability: 0.01 }
results { alternatives { transcript: " that is" } stability: 0.9 } results { alternatives { transcript: " the question" } stability: 0.01 }
results { alternatives { transcript: " that is the question" confidence: 0.98 } alternatives { transcript: " that was the question" } is_final: true }
Notas:
Apenas duas das respostas acima, a n.º 4 e a n.º 7, contêm resultados finais. Estas estão indicadas com
is_final: true. A concatenação destes elementos gera a transcrição completa: "ser ou não ser, eis a questão".Os outros contêm dados provisórios
results. Os exemplos n.º 3 e n.º 6 contêm doisresultsprovisórios: a primeira parte tem uma estabilidade elevada e é menos provável que mude; a segunda parte tem uma estabilidade baixa e é muito provável que mude. Um designer de IU pode optar por mostrar apenas a estabilidade elevadaresults.Os valores específicos de
stabilityeconfidenceapresentados acima destinam-se apenas a fins ilustrativos. Os valores reais podem variar.Em cada resposta, apenas um destes campos é definido:
error,speech_event_typeou um ou mais (repetidos)results.
| Campos | |
|---|---|
results[] |
Esta lista repetida contém zero ou mais resultados que correspondem a partes consecutivas do áudio que está a ser processado. Contém zero ou um resultado |
speech_event_type |
Indica o tipo de evento de voz. |
speech_event_offset |
Desvio de tempo entre o início da emissão de áudio e de eventos. |
metadata |
Metadados sobre o reconhecimento. |
SpeechEventType
Indica o tipo de evento de voz.
| Enumerações | |
|---|---|
SPEECH_EVENT_TYPE_UNSPECIFIED |
Nenhum evento de voz especificado. |
END_OF_SINGLE_UTTERANCE |
Este evento indica que o servidor detetou o fim da expressão de voz do utilizador e não espera mais voz. Por conseguinte, o servidor não processa áudio adicional e fecha a stream bidirecional gRPC. Este evento só é enviado se tiver ocorrido uma interrupção forçada devido à deteção precoce de silêncio. Este evento só está disponível através da app latest_short model. |
SPEECH_ACTIVITY_BEGIN |
Este evento indica que o servidor detetou o início da atividade de voz humana na stream. Este evento pode ser devolvido várias vezes se a fala começar e parar repetidamente ao longo da transmissão. Este evento só é enviado se voice_activity_events estiver definido como verdadeiro. |
SPEECH_ACTIVITY_END |
Este evento indica que o servidor detetou o fim da atividade de voz humana na stream. Este evento pode ser devolvido várias vezes se a fala começar e parar repetidamente ao longo da transmissão. Este evento só é enviado se voice_activity_events estiver definido como verdadeiro. |
TranscriptNormalization
Configuração de normalização da transcrição. Use a normalização da transcrição para substituir automaticamente partes da transcrição por expressões à sua escolha. Para o StreamingRecognize, esta normalização aplica-se apenas a transcrições parciais estáveis (estabilidade > 0,8) e transcrições finais.
| Campos | |
|---|---|
entries[] |
Uma lista de entradas de substituição. Vamos fazer a substituição com uma entrada de cada vez. Por exemplo, a segunda entrada em ["cat" => "dog", "mountain cat" => "mountain dog"] nunca é aplicada porque processamos sempre a primeira entrada antes. No máximo, 100 entradas. |
Entrada
Uma única configuração de substituição.
| Campos | |
|---|---|
search |
O que substituir. O comprimento máximo é de 100 carateres. |
replace |
O que deve substituir. O comprimento máximo é de 100 carateres. |
case_sensitive |
Se a pesquisa é sensível a maiúsculas e minúsculas. |
TranslationConfig
Configuração da tradução. Use para traduzir o áudio fornecido em texto para o idioma pretendido.
| Campos | |
|---|---|
target_language |
Obrigatório. O código do idioma para o qual traduzir. |
UndeleteCustomClassRequest
Mensagem de pedido para o método UndeleteCustomClass.
| Campos | |
|---|---|
name |
Obrigatório. O nome da classe personalizada a anular a eliminação. Formato: |
validate_only |
Se estiver definido, valida o pedido e pré-visualiza a CustomClass não eliminada, mas não a repõe efetivamente. |
etag |
Esta soma de verificação é calculada pelo servidor com base no valor de outros campos. Isto pode ser enviado em pedidos de atualização, anulação da eliminação e eliminação para garantir que o cliente tem um valor atualizado antes de continuar. |
UndeletePhraseSetRequest
Mensagem de pedido para o método UndeletePhraseSet.
| Campos | |
|---|---|
name |
Obrigatório. O nome do PhraseSet a anular a eliminação. Formato: |
validate_only |
Se estiver definido, valida o pedido e pré-visualiza o PhraseSet não eliminado, mas não o elimina efetivamente. |
etag |
Esta soma de verificação é calculada pelo servidor com base no valor de outros campos. Isto pode ser enviado em pedidos de atualização, anulação da eliminação e eliminação para garantir que o cliente tem um valor atualizado antes de continuar. |
UndeleteRecognizerRequest
Mensagem de pedido para o método UndeleteRecognizer.
| Campos | |
|---|---|
name |
Obrigatório. O nome do Recognizer a anular a eliminação. Formato: |
validate_only |
Se estiver definido, valida o pedido e pré-visualiza o Recognizer não eliminado, mas não o elimina efetivamente. |
etag |
Esta soma de verificação é calculada pelo servidor com base no valor de outros campos. Isto pode ser enviado em pedidos de atualização, anulação da eliminação e eliminação para garantir que o cliente tem um valor atualizado antes de continuar. |
UpdateConfigRequest
Mensagem de pedido para o método UpdateConfig.
| Campos | |
|---|---|
config |
Obrigatório. A configuração a atualizar. O campo |
update_mask |
A lista de campos a atualizar. |
UpdateCustomClassRequest
Mensagem de pedido para o método UpdateCustomClass.
| Campos | |
|---|---|
custom_class |
Obrigatório. O CustomClass a atualizar. O campo |
update_mask |
A lista de campos a atualizar. Se estiver vazio, todos os campos são considerados para atualização. |
validate_only |
Se estiver definida, valida o pedido e pré-visualiza a CustomClass atualizada, mas não a atualiza efetivamente. |
UpdatePhraseSetRequest
Mensagem de pedido para o método UpdatePhraseSet.
| Campos | |
|---|---|
phrase_set |
Obrigatório. O PhraseSet a atualizar. O campo |
update_mask |
A lista de campos a atualizar. Se estiver vazio, todos os campos com valores não predefinidos são considerados para atualização. Use |
validate_only |
Se estiver definida, valida o pedido e pré-visualiza o PhraseSet atualizado, mas não o atualiza efetivamente. |
UpdateRecognizerRequest
Mensagem de pedido para o método UpdateRecognizer.
| Campos | |
|---|---|
recognizer |
Obrigatório. O Recognizer a atualizar. O campo |
update_mask |
A lista de campos a atualizar. Se estiver vazio, todos os campos com valores não predefinidos são considerados para atualização. Use |
validate_only |
Se estiver definida, valida o pedido e pré-visualiza o Recognizer atualizado, mas não o atualiza efetivamente. |
VttOutputFileFormatConfig
Este tipo não tem campos.
Configurações de saída para o ficheiro de legendas no formato WebVTT.
WordInfo
Informações específicas de palavras para palavras reconhecidas.
| Campos | |
|---|---|
start_offset |
Desvio de tempo relativo ao início do áudio e correspondente ao início da palavra falada. Este campo só é definido se |
end_offset |
Desvio de tempo relativo ao início do áudio e correspondente ao fim da palavra falada. Este campo só é definido se |
word |
A palavra correspondente a este conjunto de informações. |
confidence |
A estimativa de confiança entre 0,0 e 1,0. Um número mais elevado indica uma probabilidade estimada maior de que as palavras reconhecidas estejam corretas. Este campo só é definido para a principal alternativa de um resultado sem streaming ou de um resultado de streaming em que |
speaker_label |
É atribuída uma etiqueta distinta a cada interlocutor no áudio. Este campo especifica qual dos oradores foi detetado a ter dito esta palavra. |