Índice
Speech(interfaz)AccessMetadata(mensaje)AccessMetadata.ConstraintType(enum)AutoDetectDecodingConfig(mensaje)BatchRecognizeFileMetadata(mensaje)BatchRecognizeFileResult(mensaje)BatchRecognizeMetadata(mensaje)BatchRecognizeRequest(mensaje)BatchRecognizeRequest.ProcessingStrategy(enum)BatchRecognizeResponse(mensaje)BatchRecognizeResults(mensaje)BatchRecognizeTranscriptionMetadata(mensaje)CloudStorageResult(mensaje)Config(mensaje)CreateCustomClassRequest(mensaje)CreatePhraseSetRequest(mensaje)CreateRecognizerRequest(mensaje)CustomClass(mensaje)CustomClass.ClassItem(mensaje)CustomClass.State(enum)DeleteCustomClassRequest(mensaje)DeletePhraseSetRequest(mensaje)DeleteRecognizerRequest(mensaje)DenoiserConfig(mensaje)ExplicitDecodingConfig(mensaje)ExplicitDecodingConfig.AudioEncoding(enum)GcsOutputConfig(mensaje)GetConfigRequest(mensaje)GetCustomClassRequest(mensaje)GetPhraseSetRequest(mensaje)GetRecognizerRequest(mensaje)InlineOutputConfig(mensaje)InlineResult(mensaje)LanguageMetadata(mensaje)ListCustomClassesRequest(mensaje)ListCustomClassesResponse(mensaje)ListPhraseSetsRequest(mensaje)ListPhraseSetsResponse(mensaje)ListRecognizersRequest(mensaje)ListRecognizersResponse(mensaje)LocationsMetadata(mensaje)ModelFeature(mensaje)ModelFeatures(mensaje)ModelMetadata(mensaje)NativeOutputFileFormatConfig(mensaje)OperationMetadata(mensaje)OutputFormatConfig(mensaje)PhraseSet(mensaje)PhraseSet.Phrase(mensaje)PhraseSet.State(enum)RecognitionConfig(mensaje)RecognitionFeatures(mensaje)RecognitionFeatures.MultiChannelMode(enum)RecognitionOutputConfig(mensaje)RecognitionResponseMetadata(mensaje)RecognizeRequest(mensaje)RecognizeResponse(mensaje)Recognizer(mensaje)Recognizer.State(enum)SpeakerDiarizationConfig(mensaje)SpeechAdaptation(mensaje)SpeechAdaptation.AdaptationPhraseSet(mensaje)SpeechRecognitionAlternative(mensaje)SpeechRecognitionResult(mensaje)SrtOutputFileFormatConfig(mensaje)StreamingRecognitionConfig(mensaje)StreamingRecognitionFeatures(mensaje)StreamingRecognitionFeatures.VoiceActivityTimeout(mensaje)StreamingRecognitionResult(mensaje)StreamingRecognizeRequest(mensaje)StreamingRecognizeResponse(mensaje)StreamingRecognizeResponse.SpeechEventType(enum)TranscriptNormalization(mensaje)TranscriptNormalization.Entry(mensaje)TranslationConfig(mensaje)UndeleteCustomClassRequest(mensaje)UndeletePhraseSetRequest(mensaje)UndeleteRecognizerRequest(mensaje)UpdateConfigRequest(mensaje)UpdateCustomClassRequest(mensaje)UpdatePhraseSetRequest(mensaje)UpdateRecognizerRequest(mensaje)VttOutputFileFormatConfig(mensaje)WordInfo(mensaje)
Voz
Permite la transcripción de voz y la gestión de recursos.
| BatchRecognize |
|---|
|
Realiza el reconocimiento de voz asíncrono por lotes: envía una solicitud con N archivos de audio y recibe una operación de larga duración que se puede sondear para ver cuándo terminan las transcripciones.
|
| CreateCustomClass |
|---|
|
Crea un
|
| CreatePhraseSet |
|---|
|
Crea un
|
| CreateRecognizer |
|---|
|
Crea un
|
| DeleteCustomClass |
|---|
|
Elimina el
|
| DeletePhraseSet |
|---|
|
Elimina el
|
| DeleteRecognizer |
|---|
|
Elimina el
|
| GetConfig |
|---|
|
Devuelve el
|
| GetCustomClass |
|---|
|
Devuelve el
|
| GetPhraseSet |
|---|
|
Devuelve el
|
| GetRecognizer |
|---|
|
Devuelve el
|
| ListCustomClasses |
|---|
|
Muestra CustomClasses.
|
| ListPhraseSets |
|---|
|
Muestra los PhraseSets.
|
| ListRecognizers |
|---|
|
Muestra los reconocedores.
|
| Reconocer |
|---|
|
Realiza el reconocimiento de voz síncrono: recibe los resultados después de que se haya enviado y procesado todo el audio.
|
| StreamingRecognize |
|---|
|
Realiza reconocimiento de voz bidireccional en streaming: recibe los resultados mientras se envía el audio. Este método solo está disponible a través de la API gRPC (no REST).
|
| UndeleteCustomClass |
|---|
|
Anula la eliminación del
|
| UndeletePhraseSet |
|---|
|
Anula la eliminación del
|
| UndeleteRecognizer |
|---|
|
Anula la eliminación del
|
| UpdateConfig |
|---|
|
Actualiza el
|
| UpdateCustomClass |
|---|
|
Actualiza el
|
| UpdatePhraseSet |
|---|
|
Actualiza el
|
| UpdateRecognizer |
|---|
|
Actualiza el
|
AccessMetadata
Metadatos de acceso de una región concreta. Esto se puede aplicar si la política de la organización del proyecto en cuestión no permite una región concreta.
| Campos | |
|---|---|
constraint_type |
Describe los diferentes tipos de restricciones que se aplican. |
ConstraintType
Describe los diferentes tipos de restricciones que se pueden aplicar a una región.
| Enumeraciones | |
|---|---|
CONSTRAINT_TYPE_UNSPECIFIED |
Se ha aplicado una restricción no especificada. |
RESOURCE_LOCATIONS_ORG_POLICY_CREATE_CONSTRAINT |
La política de organización del proyecto no permite la región indicada. |
AutoDetectDecodingConfig
Este tipo no tiene campos.
Parámetros de decodificación detectados automáticamente. Se admite en las siguientes codificaciones:
WAV_LINEAR16: muestras PCM little-endian de 16 bits con signo en un contenedor WAV.
WAV_MULAW: muestras mulaw comprimidas de 8 bits en un contenedor WAV.
WAV_ALAW: muestras alaw comprimidas de 8 bits en un contenedor WAV.
RFC4867_5_AMR: marcos AMR con un encabezado rfc4867.5.
RFC4867_5_AMRWB: marcos AMR-WB con un encabezado rfc4867.5.
FLAC: fotogramas FLAC en el formato de contenedor "FLAC nativo".
MP3: marcos de audio MPEG con metadatos ID3 opcionales (se ignoran).
OGG_OPUS: fotogramas de audio Opus en un contenedor Ogg.
WEBM_OPUS: fotogramas de audio Opus en un contenedor WebM.
MP4_AAC: fotogramas de audio AAC en un contenedor MP4.
M4A_AAC: fotogramas de audio AAC en un contenedor M4A.
MOV_AAC: fotogramas de audio AAC en un contenedor MOV.
BatchRecognizeFileMetadata
Metadatos sobre un solo archivo de un lote para BatchRecognize.
| Campos | |
|---|---|
config |
Funciones y metadatos de audio que se van a usar para el reconocimiento automático del habla. Este campo, junto con el campo |
config_mask |
Lista de campos de |
Campo de unión audio_source. La fuente de audio, que es un URI de Google Cloud Storage. audio_source solo puede ser una de estas dos opciones: |
|
uri |
URI de Cloud Storage del archivo de audio. |
BatchRecognizeFileResult
Resultados finales de un solo archivo.
| Campos | |
|---|---|
error |
Error si se ha producido alguno. |
metadata |
|
uri |
Obsoleto. En su lugar, usa |
transcript |
Obsoleto. En su lugar, usa |
Campo de unión
|
|
cloud_storage_result |
Resultados del reconocimiento escritos en Cloud Storage. Este campo solo se rellena cuando se define |
inline_result |
Resultados de reconocimiento. Este campo solo se rellena cuando se define |
BatchRecognizeMetadata
Metadatos de la operación de BatchRecognize.
| Campos | |
|---|---|
transcription_metadata |
Asigna el nombre de archivo proporcionado a los metadatos de transcripción de ese archivo. |
BatchRecognizeRequest
Mensaje de solicitud del método BatchRecognize.
| Campos | |
|---|---|
recognizer |
Obligatorio. Nombre del Recognizer que se va a usar durante el reconocimiento. El formato esperado es |
config |
Funciones y metadatos de audio que se van a usar para el reconocimiento automático del habla. Este campo, junto con el campo |
config_mask |
Lista de campos de |
files[] |
Archivos de audio con metadatos de archivo para el reconocimiento automático del habla. Se pueden especificar un máximo de 15 archivos. |
recognition_output_config |
Opciones de configuración para determinar dónde se generarán las transcripciones de cada archivo. |
processing_strategy |
Estrategia de procesamiento que se va a usar en esta solicitud. |
ProcessingStrategy
Posibles estrategias de procesamiento para solicitudes por lotes.
| Enumeraciones | |
|---|---|
PROCESSING_STRATEGY_UNSPECIFIED |
Valor predeterminado de la estrategia de procesamiento. La solicitud se procesa en cuanto se recibe. |
DYNAMIC_BATCHING |
Si se selecciona, procesa la solicitud durante los periodos de menor utilización para obtener un descuento. La solicitud se completa en un plazo de 24 horas. |
BatchRecognizeResponse
Mensaje de respuesta de BatchRecognize que se empaqueta en un Operation de larga duración.
| Campos | |
|---|---|
results |
Asigna el nombre de archivo al resultado final de ese archivo. |
total_billed_duration |
Cuando esté disponible, los segundos de audio facturados de la solicitud correspondiente. |
BatchRecognizeResults
Tipo de salida de Cloud Storage de las transcripciones de BatchRecognize. Aunque este archivo proto no se devuelve en ninguna parte de esta API, las transcripciones de Cloud Storage se serializarán en este archivo proto y se deben analizar como tal.
| Campos | |
|---|---|
results[] |
Lista secuencial de resultados de transcripción correspondientes a partes secuenciales de audio. |
metadata |
Metadatos sobre el reconocimiento. |
BatchRecognizeTranscriptionMetadata
Metadatos sobre la transcripción de un solo archivo (por ejemplo, el porcentaje de progreso).
| Campos | |
|---|---|
progress_percent |
Cuánto del archivo se ha transcrito hasta el momento. |
error |
Error si se ha producido alguno. |
uri |
El URI de Cloud Storage en el que se escribirán los resultados del reconocimiento. |
CloudStorageResult
Los resultados finales se escriben en Cloud Storage.
| Campos | |
|---|---|
uri |
El URI de Cloud Storage en el que se escribieron los resultados del reconocimiento. |
vtt_format_uri |
El URI de Cloud Storage en el que se escribieron los resultados del reconocimiento como subtítulos con formato VTT. Este campo solo se rellena cuando se solicita la salida |
srt_format_uri |
El URI de Cloud Storage en el que se escribieron los resultados del reconocimiento como subtítulos con formato SRT. Este campo solo se rellena cuando se solicita la salida |
Configuración
Mensaje que representa la configuración de la API Speech-to-Text. Esto incluye una clave de KMS opcional con la que se cifrarán los datos entrantes.
| Campos | |
|---|---|
name |
Solo de salida. Identificador. Nombre del recurso de configuración. Hay exactamente un recurso de configuración por proyecto y por ubicación. El formato esperado es |
kms_key_name |
Opcional. Un nombre de clave de KMS opcional que, si se proporciona, se usará para cifrar los recursos de Speech-to-Text en reposo. Al actualizar esta clave, no se cifrarán los recursos que ya la usen. Solo se cifrarán los recursos nuevos. El formato esperado es |
update_time |
Solo de salida. La hora más reciente en la que se modificó este recurso. |
CreateCustomClassRequest
Mensaje de solicitud del método CreateCustomClass.
| Campos | |
|---|---|
custom_class |
Obligatorio. CustomClass que se va a crear. |
validate_only |
Si se define, valida la solicitud y muestra una vista previa de CustomClass, pero no la crea. |
custom_class_id |
ID que se va a usar en CustomClass, que se convertirá en el componente final del nombre de recurso de CustomClass. Este valor debe tener entre 4 y 63 caracteres, y los caracteres válidos son /[a-z][0-9]-/. |
parent |
Obligatorio. El proyecto y la ubicación en los que se creará este CustomClass. El formato esperado es |
CreatePhraseSetRequest
Mensaje de solicitud del método CreatePhraseSet.
| Campos | |
|---|---|
phrase_set |
Obligatorio. PhraseSet que se va a crear. |
validate_only |
Si se define, valida la solicitud y muestra una vista previa de PhraseSet, pero no la crea. |
phrase_set_id |
ID que se va a usar en el PhraseSet, que se convertirá en el componente final del nombre del recurso de PhraseSet. Este valor debe tener entre 4 y 63 caracteres, y los caracteres válidos son /[a-z][0-9]-/. |
parent |
Obligatorio. Proyecto y ubicación en los que se creará este PhraseSet. El formato esperado es |
CreateRecognizerRequest
Mensaje de solicitud del método CreateRecognizer.
| Campos | |
|---|---|
recognizer |
Obligatorio. El Recognizer que se va a crear. |
validate_only |
Si se define, valida la solicitud y previsualiza el Recognizer, pero no lo crea. |
recognizer_id |
ID que se va a usar en el Recognizer, que se convertirá en el componente final del nombre de recurso del Recognizer. Este valor debe tener entre 4 y 63 caracteres, y los caracteres válidos son /[a-z][0-9]-/. |
parent |
Obligatorio. El proyecto y la ubicación en los que se creará este Recognizer. El formato esperado es |
CustomClass
CustomClass para sesgos en el reconocimiento de voz. Se usa para definir un conjunto de palabras o frases que representan un concepto o un tema comunes que es probable que aparezcan en tu audio. Por ejemplo, una lista de nombres de barcos de pasajeros.
| Campos | |
|---|---|
name |
Solo de salida. Identificador. Nombre de recurso de CustomClass. Formato: |
uid |
Solo de salida. Identificador único asignado por el sistema a CustomClass. |
display_name |
Opcional. Nombre legible por humanos que se puede definir para CustomClass. Debe tener 63 caracteres como máximo. |
items[] |
Colección de elementos de clase. |
state |
Solo de salida. El estado del ciclo de vida de CustomClass. |
create_time |
Solo de salida. Hora de creación. |
update_time |
Solo de salida. La hora más reciente en la que se modificó este recurso. |
delete_time |
Solo de salida. Hora a la que se solicitó la eliminación de este recurso. |
expire_time |
Solo de salida. La hora a la que se purgará este recurso. |
annotations |
Opcional. Permite a los usuarios almacenar pequeñas cantidades de datos arbitrarios. Tanto la clave como el valor deben tener 63 caracteres como máximo. Un máximo de 100 anotaciones. |
etag |
Solo de salida. El servidor calcula esta suma de comprobación en función del valor de otros campos. Puede enviarse en solicitudes de actualización, restauración y eliminación para asegurarse de que el cliente tenga un valor actualizado antes de continuar. |
reconciling |
Solo de salida. Indica si se está actualizando esta CustomClass. |
kms_key_name |
Solo de salida. El nombre de la clave de KMS con la que se encripta CustomClass. El formato esperado es |
kms_key_version_name |
Solo de salida. El nombre de la versión de la clave de KMS con la que se cifra CustomClass. El formato esperado es |
ClassItem
Un elemento de la clase.
| Campos | |
|---|---|
value |
Valor del elemento de clase. |
Estado
Conjunto de estados que definen el ciclo de vida de un CustomClass.
| Enumeraciones | |
|---|---|
STATE_UNSPECIFIED |
Estado sin especificar. Solo se usa o es útil para distinguir los valores no definidos. |
ACTIVE |
El estado normal y el estado activo. |
DELETED |
Se ha eliminado este CustomClass. |
DeleteCustomClassRequest
Mensaje de solicitud del método DeleteCustomClass.
| Campos | |
|---|---|
name |
Obligatorio. Nombre del CustomClass que se va a eliminar. Formato: |
validate_only |
Si se define, valida la solicitud y muestra una vista previa de la CustomClass eliminada, pero no la elimina. |
allow_missing |
Si se le asigna el valor true y no se encuentra CustomClass, la solicitud se completará correctamente y no se realizará ninguna operación (en este caso, no se registrará ninguna operación). |
etag |
El servidor calcula esta suma de comprobación en función del valor de otros campos. Puede enviarse en solicitudes de actualización, restauración y eliminación para asegurarse de que el cliente tenga un valor actualizado antes de continuar. |
DeletePhraseSetRequest
Mensaje de solicitud del método DeletePhraseSet.
| Campos | |
|---|---|
name |
Obligatorio. Nombre del objeto PhraseSet que se va a eliminar. Formato: |
validate_only |
Si se define, valida la solicitud y muestra una vista previa del objeto PhraseSet eliminado, pero no lo elimina. |
allow_missing |
Si se le asigna el valor true y no se encuentra el PhraseSet, la solicitud se completará correctamente y no se realizará ninguna operación (en este caso, no se registrará ninguna operación). |
etag |
El servidor calcula esta suma de comprobación en función del valor de otros campos. Puede enviarse en solicitudes de actualización, restauración y eliminación para asegurarse de que el cliente tenga un valor actualizado antes de continuar. |
DeleteRecognizerRequest
Mensaje de solicitud del método DeleteRecognizer.
| Campos | |
|---|---|
name |
Obligatorio. Nombre del Recognizer que se va a eliminar. Formato: |
validate_only |
Si se define, valida la solicitud y muestra una vista previa del Recognizer eliminado, pero no lo elimina. |
allow_missing |
Si se le asigna el valor true y no se encuentra el Recognizer, la solicitud se completará correctamente y no se realizará ninguna operación (no se registrará ninguna operación en este caso). |
etag |
El servidor calcula esta suma de comprobación en función del valor de otros campos. Puede enviarse en solicitudes de actualización, restauración y eliminación para asegurarse de que el cliente tenga un valor actualizado antes de continuar. |
DenoiserConfig
Configuración de reducción de ruido. Puede que no sea compatible con todos los modelos y que no tenga ningún efecto.
| Campos | |
|---|---|
denoise_audio |
Elimina el ruido del audio antes de enviarlo al modelo de transcripción. |
snr_threshold |
Umbral de la relación señal/ruido (SNR) del eliminador de ruido. En este caso, SNR significa la intensidad de la señal de voz. El audio con una relación señal/ruido inferior a este umbral, lo que significa que la voz es demasiado baja, no se enviará al modelo de transcripción. Si snr_threshold=0, no se aplicará ningún filtro. |
ExplicitDecodingConfig
Parámetros de decodificación especificados explícitamente.
| Campos | |
|---|---|
encoding |
Obligatorio. Codificación de los datos de audio enviados para el reconocimiento. |
sample_rate_hertz |
Opcional. Frecuencia de muestreo en hercios de los datos de audio enviados para el reconocimiento. Los valores válidos son de 8000 a 48000, y 16000 es el valor óptimo. Para obtener los mejores resultados, define la frecuencia de muestreo de la fuente de audio en 16.000 Hz. Si no es posible, usa la frecuencia de muestreo nativa de la fuente de audio (en lugar de remuestrear). Ten en cuenta que este campo está marcado como OPCIONAL por motivos de retrocompatibilidad. Es (y siempre ha sido) OBLIGATORIO. |
audio_channel_count |
Opcional. Número de canales presentes en los datos de audio enviados para el reconocimiento. Ten en cuenta que este campo está marcado como OPCIONAL por motivos de retrocompatibilidad. Es (y siempre ha sido) OBLIGATORIO. El valor máximo permitido es 8. |
AudioEncoding
Codificaciones de datos de audio admitidas.
| Enumeraciones | |
|---|---|
AUDIO_ENCODING_UNSPECIFIED |
Valor predeterminado. Este valor no se usa. |
LINEAR16 |
Muestras PCM de 16 bits con signo y orden de bytes menor, sin encabezado. |
MULAW |
Muestras de ley mu compuestas de 8 bits sin encabezado. |
ALAW |
Muestras de alaw comprimidas de 8 bits sin encabezado. |
AMR |
Marcos AMR con un encabezado rfc4867.5. |
AMR_WB |
Marcos AMR-WB con un encabezado rfc4867.5. |
FLAC |
Marcos FLAC en el formato de contenedor "FLAC nativo". |
MP3 |
Marcos de audio MPEG con metadatos ID3 opcionales (se ignoran). |
OGG_OPUS |
Tramas de audio Opus en un contenedor Ogg. |
WEBM_OPUS |
Marcos de audio Opus en un contenedor WebM. |
MP4_AAC |
Tramas de audio AAC en un contenedor MP4. |
M4A_AAC |
Tramas de audio AAC en un contenedor M4A. |
MOV_AAC |
Tramas de audio AAC en un contenedor MOV. |
GcsOutputConfig
Configuraciones de salida de Cloud Storage.
| Campos | |
|---|---|
uri |
El prefijo del URI de Cloud Storage con el que se escribirán los resultados del reconocimiento. |
GetConfigRequest
Mensaje de solicitud del método GetConfig.
| Campos | |
|---|---|
name |
Obligatorio. Nombre de la configuración que se va a obtener. Hay exactamente un recurso de configuración por proyecto y por ubicación. El formato esperado es |
GetCustomClassRequest
Mensaje de solicitud del método GetCustomClass.
| Campos | |
|---|---|
name |
Obligatorio. Nombre de la CustomClass que se va a obtener. El formato esperado es |
GetPhraseSetRequest
Mensaje de solicitud del método GetPhraseSet.
| Campos | |
|---|---|
name |
Obligatorio. Nombre del PhraseSet que se va a obtener. El formato esperado es |
GetRecognizerRequest
Mensaje de solicitud del método GetRecognizer.
| Campos | |
|---|---|
name |
Obligatorio. Nombre del Recognizer que se va a obtener. El formato esperado es |
InlineOutputConfig
Este tipo no tiene campos.
Configuraciones de salida de la respuesta insertada.
InlineResult
Resultados finales devueltos en línea en la respuesta de reconocimiento.
| Campos | |
|---|---|
transcript |
La transcripción del archivo de audio. |
vtt_captions |
La transcripción del archivo de audio en formato VTT. Este campo solo se rellena cuando se solicita la salida |
srt_captions |
La transcripción del archivo de audio en formato SRT. Este campo solo se rellena cuando se solicita la salida |
LanguageMetadata
Los metadatos sobre las configuraciones regionales disponibles en una región determinada. Actualmente, solo se muestran los modelos disponibles para cada configuración regional.
| Campos | |
|---|---|
models |
Mapa de configuración regional (código de idioma) -> modelos |
ListCustomClassesRequest
Mensaje de solicitud del método ListCustomClasses.
| Campos | |
|---|---|
parent |
Obligatorio. El proyecto y la ubicación de los recursos CustomClass que se van a enumerar. El formato esperado es |
page_size |
Número de resultados por solicitud. El valor de page_size debe estar comprendido entre 0 y 100 (ambos incluidos). Si el valor de page_size es cero o no se especifica, se elegirá un tamaño de página de 5. Si el tamaño de página supera las 100, se reducirá a 100. Ten en cuenta que una llamada puede devolver menos resultados que el tamaño de página solicitado. |
page_token |
Token de página recibido de una llamada Al hacer la paginación, todos los demás parámetros proporcionados a |
show_deleted |
Indica si se deben mostrar los recursos que se han eliminado. |
ListCustomClassesResponse
Mensaje de respuesta del método ListCustomClasses.
| Campos | |
|---|---|
custom_classes[] |
Lista de CustomClasses solicitadas. |
next_page_token |
Token que se puede enviar como |
ListPhraseSetsRequest
Mensaje de solicitud del método ListPhraseSets.
| Campos | |
|---|---|
parent |
Obligatorio. El proyecto y la ubicación de los recursos de PhraseSet que se van a enumerar. El formato esperado es |
page_size |
Número máximo de PhraseSets que se devolverán. Es posible que el servicio devuelva un número inferior a este valor. Si no se especifica, se devolverán 5 PhraseSets como máximo. El valor máximo es 100; los valores superiores a este límite se convertirán a 100. |
page_token |
Token de página recibido de una llamada Al hacer la paginación, todos los demás parámetros proporcionados a |
show_deleted |
Indica si se deben mostrar los recursos que se han eliminado. |
ListPhraseSetsResponse
Mensaje de respuesta del método ListPhraseSets.
| Campos | |
|---|---|
phrase_sets[] |
Lista de PhraseSets solicitados. |
next_page_token |
Token que se puede enviar como |
ListRecognizersRequest
Mensaje de solicitud del método ListRecognizers.
| Campos | |
|---|---|
parent |
Obligatorio. El proyecto y la ubicación de los reconocedores que se van a enumerar. El formato esperado es |
page_size |
Número máximo de Recognizers que se devolverán. Es posible que el servicio devuelva un número inferior a este valor. Si no se especifica, se devolverán 5 Recognizers como máximo. El valor máximo es 100; los valores superiores a este límite se convertirán a 100. |
page_token |
Token de página recibido de una llamada Al hacer la paginación, todos los demás parámetros proporcionados a |
show_deleted |
Indica si se deben mostrar los recursos que se han eliminado. |
ListRecognizersResponse
Mensaje de respuesta del método ListRecognizers.
| Campos | |
|---|---|
recognizers[] |
Lista de Recognizers solicitados. |
next_page_token |
Token que se puede enviar como |
LocationsMetadata
Metadatos principales de la API Locations de STT V2. Actualmente, solo se trata de los metadatos sobre las configuraciones regionales, los modelos y las funciones.
| Campos | |
|---|---|
languages |
Información sobre las configuraciones regionales, los modelos y las funciones disponibles representados en la estructura jerárquica de configuraciones regionales, modelos y funciones |
access_metadata |
Información sobre los metadatos de acceso de la región y el proyecto en cuestión. |
ModelFeature
Representa una función singular de un modelo. Si la función es recognizer, el valor de release_state de la función representa el valor de release_state del modelo.
| Campos | |
|---|---|
feature |
El nombre de la función (nota: la función puede ser |
release_state |
El estado de lanzamiento de la función |
ModelFeatures
Representa la colección de funciones que pertenecen a un modelo.
| Campos | |
|---|---|
model_feature[] |
Campo repetido que contiene todas las características del modelo. |
ModelMetadata
Los metadatos sobre los modelos de una región determinada para una configuración regional específica. Actualmente, solo se muestran las funciones del modelo
| Campos | |
|---|---|
model_features |
Mapa del nombre del modelo -> funciones de ese modelo |
NativeOutputFileFormatConfig
Este tipo no tiene campos.
Configuraciones de salida para protos BatchRecognizeResults serializados.
OperationMetadata
Representa los metadatos de una operación de larga duración.
| Campos | |
|---|---|
create_time |
Hora en la que se creó la operación. |
update_time |
Hora a la que se actualizó la operación por última vez. |
resource |
Ruta del recurso de destino de la operación. |
method |
El método que ha activado la operación. |
kms_key_name |
El nombre de la clave del KMS con la que se cifra el contenido de la operación. El formato esperado es |
kms_key_version_name |
El nombre de la versión de la clave de KMS con la que se cifra el contenido de la operación. El formato esperado es |
progress_percent |
Porcentaje de progreso de la operación. Los valores pueden oscilar entre 0 y 100. Si el valor es 100, significa que la operación ha finalizado. |
Campo de unión request. La solicitud que ha generado la operación. request solo puede ser una de estas dos opciones: |
|
batch_recognize_request |
BatchRecognizeRequest que ha generado la operación. |
create_recognizer_request |
CreateRecognizerRequest que ha generado la operación. |
update_recognizer_request |
UpdateRecognizerRequest que ha generado la operación. |
delete_recognizer_request |
DeleteRecognizerRequest que ha generado la operación. |
undelete_recognizer_request |
UndeleteRecognizerRequest que ha generado la operación. |
create_custom_class_request |
CreateCustomClassRequest que ha generado la operación. |
update_custom_class_request |
UpdateCustomClassRequest que ha generado la operación. |
delete_custom_class_request |
DeleteCustomClassRequest que ha generado la operación. |
undelete_custom_class_request |
UndeleteCustomClassRequest que ha generado la operación. |
create_phrase_set_request |
CreatePhraseSetRequest que ha generado la operación. |
update_phrase_set_request |
UpdatePhraseSetRequest que ha generado la operación. |
delete_phrase_set_request |
DeletePhraseSetRequest que ha generado la operación. |
undelete_phrase_set_request |
UndeletePhraseSetRequest que ha generado la operación. |
update_config_request |
UpdateConfigRequest que ha generado la operación. |
Campo de unión metadata. Metadatos específicos por RPC. metadata solo puede ser una de estas dos opciones: |
|
batch_recognize_metadata |
Metadatos específicos del método BatchRecognize. |
OutputFormatConfig
Configuración del formato de los resultados almacenados en output.
| Campos | |
|---|---|
native |
Configuración del formato de salida nativo. Si se define este campo o no se define ningún otro campo de formato de salida, las transcripciones se escribirán en el receptor en el formato nativo. |
vtt |
Configuración del formato de salida VTT. Si se define este campo, las transcripciones se escribirán en el receptor en formato VTT. |
srt |
Configuración del formato de salida SRT. Si se define este campo, las transcripciones se escribirán en el sumidero en formato SRT. |
PhraseSet
PhraseSet para sesgos en el reconocimiento de voz. Un PhraseSet se usa para proporcionar "sugerencias" al reconocedor de voz para que favorezca palabras y frases específicas en los resultados.
| Campos | |
|---|---|
name |
Solo de salida. Identificador. Nombre de recurso de PhraseSet. Formato: |
uid |
Solo de salida. Identificador único asignado por el sistema al objeto PhraseSet. |
phrases[] |
Una lista de palabras y frases. |
boost |
Pista. Un valor positivo aumentará la probabilidad de que se reconozca una frase específica en lugar de otras frases que suenen de forma similar. Cuanto mayor sea el aumento, mayor será la probabilidad de que se produzcan falsos positivos. Los valores válidos de |
display_name |
Nombre legible por humanos que puede definir el usuario para el PhraseSet. Debe tener 63 caracteres como máximo. |
state |
Solo de salida. El estado del ciclo de vida de PhraseSet. |
create_time |
Solo de salida. Hora de creación. |
update_time |
Solo de salida. La hora más reciente en la que se modificó este recurso. |
delete_time |
Solo de salida. Hora a la que se solicitó la eliminación de este recurso. |
expire_time |
Solo de salida. La hora a la que se purgará este recurso. |
annotations |
Permite a los usuarios almacenar pequeñas cantidades de datos arbitrarios. Tanto la clave como el valor deben tener 63 caracteres como máximo. Un máximo de 100 anotaciones. |
etag |
Solo de salida. El servidor calcula esta suma de comprobación en función del valor de otros campos. Puede enviarse en solicitudes de actualización, restauración y eliminación para asegurarse de que el cliente tenga un valor actualizado antes de continuar. |
reconciling |
Solo de salida. Indica si este PhraseSet se está actualizando o no. |
kms_key_name |
Solo de salida. El nombre de la clave de KMS con el que se cifra el PhraseSet. El formato esperado es |
kms_key_version_name |
Solo de salida. El nombre de la versión de la clave de KMS con la que se cifra el PhraseSet. El formato esperado es |
Frase
Una frase contiene palabras y "sugerencias" de frases para que el reconocimiento de voz tenga más probabilidades de reconocerlas. Esto se puede utilizar para mejorar la precisión de palabras y frases específicas, por ejemplo, si el usuario suele pronunciar comandos específicos. Esto también se puede usar para agregar palabras adicionales al vocabulario del reconocedor.
Los elementos de lista también pueden incluir referencias CustomClass que contengan grupos de palabras que representen conceptos comunes que se dan en el lenguaje natural.
| Campos | |
|---|---|
value |
La frase en sí. |
boost |
Pista. Anula el refuerzo definido a nivel de conjunto de frases. Un valor positivo aumentará la probabilidad de que se reconozca una frase específica en lugar de otras frases que suenen de forma similar. Cuanto mayor sea el aumento, mayor será la probabilidad de que se produzcan falsos positivos. Los valores de impulso negativos se corresponderían con la eliminación de sesgos. El ajuste para evitar sesgos no está habilitado, por lo que los valores de impulso negativos devolverán un error. Los valores de impulso deben estar comprendidos entre 0 y 20. Cualquier valor fuera de ese intervalo devolverá un error. Te recomendamos que uses una búsqueda binaria para encontrar el valor óptimo de tu caso práctico, así como que añadas frases con y sin refuerzo a tus solicitudes. |
Estado
Conjunto de estados que definen el ciclo de vida de un PhraseSet.
| Enumeraciones | |
|---|---|
STATE_UNSPECIFIED |
Estado sin especificar. Solo se usa o es útil para distinguir los valores no definidos. |
ACTIVE |
El estado normal y el estado activo. |
DELETED |
Se ha eliminado este PhraseSet. |
RecognitionConfig
Proporciona información al Recognizer que especifica cómo procesar la solicitud de reconocimiento.
| Campos | |
|---|---|
model |
Opcional. Qué modelo se debe usar para las solicitudes de reconocimiento. Selecciona el modelo que mejor se adapte a tu dominio para obtener los mejores resultados. Puedes consultar las directrices para elegir el modelo que vas a usar en la documentación de los modelos de transcripción y los modelos admitidos en cada región en la tabla de modelos admitidos. |
language_codes[] |
Opcional. El idioma del audio proporcionado como etiqueta de idioma BCP-47. Las etiquetas de idioma se normalizan a BCP-47 antes de usarse. Por ejemplo, "en-us" se convierte en "en-US". Los idiomas admitidos para cada modelo se indican en la tabla de modelos admitidos. Si se proporcionan idiomas adicionales, el resultado del reconocimiento contendrá el reconocimiento en el idioma detectado más probable. El resultado del reconocimiento incluirá la etiqueta de idioma del idioma detectado en el audio. |
features |
Funciones de reconocimiento de voz que se van a habilitar. |
adaptation |
Contexto de adaptación del habla que pondera las predicciones del reconocedor para palabras y frases específicas. |
transcript_normalization |
Opcional. Usa la normalización de la transcripción para sustituir automáticamente partes de la transcripción por las frases que elijas. En el caso de StreamingRecognize, esta normalización solo se aplica a las transcripciones parciales estables (estabilidad > 0,8) y a las transcripciones finales. |
translation_config |
Opcional. Configuración opcional que se usa para ejecutar automáticamente la traducción del audio proporcionado al idioma deseado en los modelos admitidos. |
denoiser_config |
Opcional. Configuración opcional de la función de reducción de ruido. Puede que no sea compatible con todos los modelos y que no tenga ningún efecto. |
Campo de unión decoding_config. Parámetros de decodificación del audio que se envía para el reconocimiento. decoding_config solo puede ser una de estas dos opciones: |
|
auto_decoding_config |
Detectar automáticamente los parámetros de decodificación. Se prefiere para los formatos admitidos. |
explicit_decoding_config |
Parámetros de decodificación especificados explícitamente. Obligatorio si se usa audio PCM sin encabezado (linear16, mulaw, alaw). |
RecognitionFeatures
Funciones de reconocimiento disponibles.
| Campos | |
|---|---|
profanity_filter |
Si se define como |
enable_word_time_offsets |
Si |
enable_word_confidence |
Si |
enable_automatic_punctuation |
Si |
enable_spoken_punctuation |
El comportamiento de la puntuación hablada de la llamada. Si |
enable_spoken_emojis |
El comportamiento de los emojis hablados en la llamada. Si el valor es |
multi_channel_mode |
Modo para reconocer audio multicanal. |
diarization_config |
Configuración para habilitar la diarización del interlocutor. Para habilitar la diarización, asigna a este campo un mensaje SpeakerDiarizationConfig vacío. |
max_alternatives |
Número máximo de hipótesis de reconocimiento que se devolverán. Es posible que el servidor devuelva menos de |
MultiChannelMode
Opciones para reconocer audio multicanal.
| Enumeraciones | |
|---|---|
MULTI_CHANNEL_MODE_UNSPECIFIED |
Valor predeterminado del modo multicanal. Si el audio contiene varios canales, solo se transcribirá el primero. Los demás se ignorarán. |
SEPARATE_RECOGNITION_PER_CHANNEL |
Si se selecciona esta opción, cada canal del audio proporcionado se transcribe de forma independiente. Esta opción no se puede seleccionar si el model seleccionado es latest_short. |
RecognitionOutputConfig
Opciones de configuración de las salidas del reconocimiento.
| Campos | |
|---|---|
output_format_config |
Opcional. Configuración del formato de los resultados almacenados en |
Campo de unión
|
|
gcs_output_config |
Si este mensaje se rellena, los resultados del reconocimiento se escriben en el URI de Google Cloud Storage proporcionado. |
inline_response_config |
Si este mensaje se rellena, los resultados del reconocimiento se proporcionan en el mensaje |
RecognitionResponseMetadata
Metadatos sobre la solicitud y la respuesta de reconocimiento.
| Campos | |
|---|---|
request_id |
Identificador de solicitud global generado automáticamente por la API. |
total_billed_duration |
Cuando esté disponible, los segundos de audio facturados de la solicitud correspondiente. |
RecognizeRequest
Mensaje de solicitud del método Recognize. Se debe proporcionar content o uri. Si se proporcionan ambos o ninguno, se devuelve INVALID_ARGUMENT. Consulta los límites de contenido.
| Campos | |
|---|---|
recognizer |
Obligatorio. Nombre del Recognizer que se va a usar durante el reconocimiento. El formato esperado es |
config |
Funciones y metadatos de audio que se van a usar para el reconocimiento automático del habla. Este campo, junto con el campo |
config_mask |
Lista de campos de |
Campo de unión audio_source. La fuente de audio, que puede ser contenido insertado o un URI de Google Cloud Storage. audio_source solo puede ser una de estas dos opciones: |
|
content |
Los bytes de datos de audio codificados tal como se especifica en |
uri |
URI que apunta a un archivo que contiene bytes de datos de audio, tal como se especifica en |
RecognizeResponse
Mensaje de respuesta del método Recognize.
| Campos | |
|---|---|
results[] |
Lista secuencial de resultados de transcripción correspondientes a partes secuenciales de audio. |
metadata |
Metadatos sobre el reconocimiento. |
Reconocedor
Un mensaje de Recognizer. Almacena la configuración y los metadatos del reconocimiento.
| Campos | |
|---|---|
name |
Solo de salida. Identificador. Nombre de recurso del Recognizer. Formato: |
uid |
Solo de salida. Identificador único asignado por el sistema al Recognizer. |
display_name |
Nombre legible por humanos que se puede asignar al reconocedor. Debe tener 63 caracteres como máximo. |
model |
Opcional. Este campo ya no está disponible. Prefiere el campo Qué modelo se debe usar para las solicitudes de reconocimiento. Selecciona el modelo que mejor se adapte a tu dominio para obtener los mejores resultados. Puedes consultar las directrices para elegir el modelo que vas a usar en la documentación de los modelos de transcripción y los modelos admitidos en cada región en la tabla de modelos admitidos. |
language_codes[] |
Opcional. Este campo ya no está disponible. Prefiere el campo El idioma del audio proporcionado como etiqueta de idioma BCP-47. Los idiomas admitidos para cada modelo se indican en la tabla de modelos admitidos. Si se proporcionan idiomas adicionales, el resultado del reconocimiento contendrá el reconocimiento en el idioma detectado más probable. El resultado del reconocimiento incluirá la etiqueta de idioma del idioma detectado en el audio. Cuando creas o actualizas un Recognizer, estos valores se almacenan en formato BCP-47 normalizado. Por ejemplo, "en-us" se almacena como "en-US". |
default_recognition_config |
Configuración predeterminada que se usará en las solicitudes con este Recognizer. Se puede sobrescribir mediante la configuración insertada en el campo |
annotations |
Permite a los usuarios almacenar pequeñas cantidades de datos arbitrarios. Tanto la clave como el valor deben tener 63 caracteres como máximo. Un máximo de 100 anotaciones. |
state |
Solo de salida. El estado del ciclo de vida de Recognizer. |
create_time |
Solo de salida. Hora de creación. |
update_time |
Solo de salida. La hora más reciente en la que se modificó este Recognizer. |
delete_time |
Solo de salida. La hora a la que se solicitó la eliminación de este Recognizer. |
expire_time |
Solo de salida. La hora a la que se purgará este Recognizer. |
etag |
Solo de salida. El servidor calcula esta suma de comprobación en función del valor de otros campos. Puede enviarse en solicitudes de actualización, restauración y eliminación para asegurarse de que el cliente tenga un valor actualizado antes de continuar. |
reconciling |
Solo de salida. Indica si este Recognizer está en proceso de actualización. |
kms_key_name |
Solo de salida. El nombre de la clave de KMS con la que se cifra el reconocedor. El formato esperado es |
kms_key_version_name |
Solo de salida. El nombre de la versión de la clave de KMS con la que se cifra el reconocedor. El formato esperado es |
Estado
Conjunto de estados que definen el ciclo de vida de un Recognizer.
| Enumeraciones | |
|---|---|
STATE_UNSPECIFIED |
El valor predeterminado. Este valor se usa si se omite el estado. |
ACTIVE |
El reconocedor está activo y listo para usarse. |
DELETED |
Se ha eliminado este reconocedor. |
SpeakerDiarizationConfig
Configuración para habilitar la diarización del interlocutor.
| Campos | |
|---|---|
min_speaker_count |
Opcional. El sistema determina automáticamente el número de altavoces. Este valor no se usa actualmente. |
max_speaker_count |
Opcional. El sistema determina automáticamente el número de altavoces. Este valor no se usa actualmente. |
SpeechAdaptation
Proporciona "sugerencias" al reconocedor de voz para favorecer palabras y frases específicas en los resultados. Los PhraseSets se pueden especificar como un recurso insertado o como una referencia a un recurso PhraseSet.
| Campos | |
|---|---|
phrase_sets[] |
Lista de PhraseSets insertados o a los que se hace referencia. |
custom_classes[] |
Lista de CustomClasses insertadas. Se puede hacer referencia directamente a los recursos CustomClass en un PhraseSet. |
AdaptationPhraseSet
Un PhraseSet de sesgo, que puede ser una cadena que haga referencia al nombre de un recurso PhraseSets o una definición insertada de un PhraseSet.
| Campos | |
|---|---|
Campo de unión
|
|
phrase_set |
Nombre de un recurso PhraseSet. El usuario debe tener acceso de lectura al recurso y este no debe haberse eliminado. |
inline_phrase_set |
Un PhraseSet definido insertado. |
SpeechRecognitionAlternative
Hipótesis alternativas (también conocidas como lista de mejor N).
| Campos | |
|---|---|
transcript |
Texto de transcripción que representa las palabras que el usuario habló. |
confidence |
La estimación de confianza se encuentra entre 0,0 y 1,0. Un número más alto indica una mayor probabilidad estimada de que las palabras reconocidas sean correctas. Este campo solo se define para la alternativa principal de un resultado que no es de streaming o de un resultado de streaming en el que |
words[] |
Una lista de información específica de la palabra para cada palabra reconocida. Cuando se haya definido el |
SpeechRecognitionResult
Un resultado de reconocimiento de voz correspondiente a una parte del audio.
| Campos | |
|---|---|
alternatives[] |
Puede contener una o varias hipótesis de reconocimiento. Estas alternativas están ordenadas en términos de precisión, siendo la alternativa principal (la primera) la más probable, según la clasificación del reconocedor. |
channel_tag |
Para audio multicanal, este es el número de canal correspondiente al resultado reconocido para el audio de ese canal. Si |
result_end_offset |
Desfase de tiempo del final de este resultado con respecto al inicio del audio. |
language_code |
Solo de salida. La etiqueta de idioma BCP-47 del idioma de este resultado. Se ha detectado que este código de idioma es el que tiene más probabilidades de ser el que se habla en el audio. |
SrtOutputFileFormatConfig
Este tipo no tiene campos.
Configuraciones de salida de archivos de subtítulos con formato SubRip Text.
StreamingRecognitionConfig
Proporciona información de configuración para la solicitud StreamingRecognize.
| Campos | |
|---|---|
config |
Obligatorio. Funciones y metadatos de audio que se van a usar para el reconocimiento automático del habla. Este campo, junto con el campo |
config_mask |
Lista de campos de |
streaming_features |
Funciones de reconocimiento de voz para habilitar solicitudes específicas de reconocimiento de audio en streaming. |
StreamingRecognitionFeatures
Funciones de reconocimiento disponibles específicas de las solicitudes de reconocimiento de streaming.
| Campos | |
|---|---|
enable_voice_activity_events |
Si |
interim_results |
Indica si se deben enviar resultados provisionales al cliente. Si se le asigna el valor true, los resultados provisionales se enviarán al cliente. De lo contrario, solo se devolverá la respuesta final. |
voice_activity_timeout |
Si se define, el servidor cerrará automáticamente el flujo una vez transcurrido el tiempo especificado después de que se haya enviado el último evento de voz VOICE_ACTIVITY. El campo |
VoiceActivityTimeout
Eventos en los que se puede definir un tiempo de espera para la actividad de voz.
| Campos | |
|---|---|
speech_start_timeout |
Duración del tiempo de espera de la emisión si no se empieza a hablar. Si se define este valor y no se detecta voz durante este periodo al inicio del flujo, el servidor cerrará el flujo. |
speech_end_timeout |
Duración del tiempo de espera de la emisión después de que termine la voz. Si se define este valor y no se detecta habla durante este periodo después de haber detectado habla, el servidor cerrará el flujo. |
StreamingRecognitionResult
Resultado de reconocimiento de voz en streaming correspondiente a una parte del audio que se está procesando.
| Campos | |
|---|---|
alternatives[] |
Puede contener una o varias hipótesis de reconocimiento. Estas alternativas están ordenadas en términos de precisión, siendo la alternativa principal (la primera) la más probable, según la clasificación del reconocedor. |
is_final |
Si |
stability |
Una estimación de la probabilidad de que el reconocedor no cambie su suposición sobre este resultado provisional. Los valores van de 0,0 (completamente inestable) a 1,0 (completamente estable). Este campo solo se proporciona para los resultados provisionales ( |
result_end_offset |
Desfase de tiempo del final de este resultado con respecto al inicio del audio. |
channel_tag |
Para audio multicanal, este es el número de canal correspondiente al resultado reconocido para el audio de ese canal. En el caso de |
language_code |
Solo de salida. La etiqueta de idioma BCP-47 del idioma de este resultado. Se ha detectado que este código de idioma es el que tiene más probabilidades de ser el que se habla en el audio. |
StreamingRecognizeRequest
Mensaje de solicitud del método StreamingRecognize. Se envían varios mensajes de StreamingRecognizeRequest en una llamada.
Si el Recognizer al que hace referencia recognizer contiene una configuración de solicitud totalmente especificada, el flujo solo puede contener mensajes con audio definido.
De lo contrario, el primer mensaje debe contener un mensaje recognizer y un mensaje streaming_config que, en conjunto, especifiquen completamente la configuración de la solicitud y no contengan audio. Todos los mensajes posteriores solo deben tener el valor audio.
| Campos | |
|---|---|
recognizer |
Obligatorio. Nombre del Recognizer que se va a usar durante el reconocimiento. El formato esperado es |
Campo de unión
|
|
streaming_config |
StreamingRecognitionConfig que se va a usar en este intento de reconocimiento. Si se proporciona, se usará en lugar del RecognitionConfig predeterminado almacenado en el Recognizer. |
audio |
Bytes de audio insertados que se van a reconocer. El tamaño máximo de este campo es de 15 kB por solicitud. |
StreamingRecognizeResponse
StreamingRecognizeResponse es el único mensaje que devuelve StreamingRecognize al cliente. Se envía al cliente una serie de cero o más mensajes StreamingRecognizeResponse. Si no hay audio reconocible, no se enviarán mensajes al cliente.
Estos son algunos ejemplos de StreamingRecognizeResponse que se pueden devolver al procesar audio:
results { alternatives { transcript: "tube" } stability: 0.01 }
results { alternatives { transcript: "to be a" } stability: 0.01 }
results { alternatives { transcript: "to be" } stability: 0.9 } results { alternatives { transcript: " or not to be" } stability: 0.01 }
results { alternatives { transcript: "to be or not to be" confidence: 0.92 } alternatives { transcript: "to bee or not to bee" } is_final: true }
results { alternatives { transcript: " that's" } stability: 0.01 }
results { alternatives { transcript: " that is" } stability: 0.9 } results { alternatives { transcript: " the question" } stability: 0.01 }
results { alternatives { transcript: " that is the question" confidence: 0.98 } alternatives { transcript: " that was the question" } is_final: true }
Notas:
Solo dos de las respuestas anteriores (la 4 y la 7) contienen resultados finales, que se indican con
is_final: true. Al concatenarlos, se genera la transcripción completa: "ser o no ser, esa es la cuestión".Los demás contienen
resultsprovisionales. Los elementos #3 y #6 contienen dosresultsprovisionales: la primera parte tiene una alta estabilidad y es menos probable que cambie; la segunda parte tiene una baja estabilidad y es muy probable que cambie. Un diseñador de interfaces de usuario puede optar por mostrar soloresultsde alta estabilidad.Los valores específicos de
stabilityyconfidenceque se muestran arriba son solo ejemplos. Los valores reales pueden variar.En cada respuesta, solo se definirá uno de estos campos:
error,speech_event_typeo uno o varios camposresults(repetidos).
| Campos | |
|---|---|
results[] |
Esta lista repetida contiene cero o más resultados que corresponden a partes consecutivas del audio que se está procesando. Contiene cero o un resultado |
speech_event_type |
Indica el tipo de evento de voz. |
speech_event_offset |
Desfase de tiempo entre el inicio del audio y la emisión del evento. |
metadata |
Metadatos sobre el reconocimiento. |
SpeechEventType
Indica el tipo de evento de voz.
| Enumeraciones | |
|---|---|
SPEECH_EVENT_TYPE_UNSPECIFIED |
No se ha especificado ningún evento de voz. |
END_OF_SINGLE_UTTERANCE |
Este evento indica que el servidor ha detectado el final de la expresión oral del usuario y no espera que diga nada más. Por lo tanto, el servidor no procesará más audio y cerrará el flujo bidireccional de gRPC. Este evento solo se envía si se ha producido un corte forzado porque se ha detectado silencio antes de tiempo. Este evento solo está disponible a través de latest_short model. |
SPEECH_ACTIVITY_BEGIN |
Este evento indica que el servidor ha detectado el inicio de la actividad de voz humana en el flujo. Este evento se puede devolver varias veces si la voz empieza y se detiene repetidamente a lo largo de la emisión. Este evento solo se envía si se le asigna el valor "true" a voice_activity_events. |
SPEECH_ACTIVITY_END |
Este evento indica que el servidor ha detectado el final de la actividad de voz humana en el flujo. Este evento se puede devolver varias veces si la voz empieza y se detiene repetidamente a lo largo de la emisión. Este evento solo se envía si se le asigna el valor "true" a voice_activity_events. |
TranscriptNormalization
Configuración de normalización de transcripciones. Usa la normalización de la transcripción para sustituir automáticamente partes de la transcripción por las frases que elijas. En el caso de StreamingRecognize, esta normalización solo se aplica a las transcripciones parciales estables (estabilidad > 0,8) y a las transcripciones finales.
| Campos | |
|---|---|
entries[] |
Una lista de entradas de sustitución. Realizaremos la sustitución de una entrada cada vez. Por ejemplo, la segunda entrada de ["cat" => "dog", "mountain cat" => "mountain dog"] nunca se aplicará porque siempre procesaremos la primera entrada antes. 100 entradas como máximo. |
Entrada
Una sola configuración de sustitución.
| Campos | |
|---|---|
search |
Qué se va a sustituir. La longitud máxima es de 100 caracteres. |
replace |
Qué se va a sustituir. La longitud máxima es de 100 caracteres. |
case_sensitive |
Indica si la búsqueda distingue entre mayúsculas y minúsculas. |
TranslationConfig
Configuración de traducción. Se usa para traducir el audio proporcionado a texto en el idioma deseado.
| Campos | |
|---|---|
target_language |
Obligatorio. El código de idioma al que se va a traducir. |
UndeleteCustomClassRequest
Mensaje de solicitud del método UndeleteCustomClass.
| Campos | |
|---|---|
name |
Obligatorio. Nombre de la CustomClass que se va a restaurar. Formato: |
validate_only |
Si se define, valida la solicitud y muestra una vista previa de la CustomClass restaurada, pero no la restaura. |
etag |
El servidor calcula esta suma de comprobación en función del valor de otros campos. Puede enviarse en solicitudes de actualización, restauración y eliminación para asegurarse de que el cliente tenga un valor actualizado antes de continuar. |
UndeletePhraseSetRequest
Mensaje de solicitud del método UndeletePhraseSet.
| Campos | |
|---|---|
name |
Obligatorio. Nombre del objeto PhraseSet que se va a restaurar. Formato: |
validate_only |
Si se define, valida la solicitud y muestra una vista previa de PhraseSet restaurado, pero no lo restaura. |
etag |
El servidor calcula esta suma de comprobación en función del valor de otros campos. Puede enviarse en solicitudes de actualización, restauración y eliminación para asegurarse de que el cliente tenga un valor actualizado antes de continuar. |
UndeleteRecognizerRequest
Mensaje de solicitud del método UndeleteRecognizer.
| Campos | |
|---|---|
name |
Obligatorio. Nombre del Recognizer que se va a restaurar. Formato: |
validate_only |
Si se define, valida la solicitud y previsualiza el Recognizer restaurado, pero no lo restaura. |
etag |
El servidor calcula esta suma de comprobación en función del valor de otros campos. Puede enviarse en solicitudes de actualización, restauración y eliminación para asegurarse de que el cliente tenga un valor actualizado antes de continuar. |
UpdateConfigRequest
Mensaje de solicitud del método UpdateConfig.
| Campos | |
|---|---|
config |
Obligatorio. La configuración que se va a actualizar. El campo |
update_mask |
Lista de campos que se van a actualizar. |
UpdateCustomClassRequest
Mensaje de solicitud del método UpdateCustomClass.
| Campos | |
|---|---|
custom_class |
Obligatorio. El objeto CustomClass que se va a actualizar. El campo |
update_mask |
Lista de campos que se van a actualizar. Si está vacío, se tendrán en cuenta todos los campos para la actualización. |
validate_only |
Si se define, valida la solicitud y muestra una vista previa de la CustomClass actualizada, pero no la actualiza. |
UpdatePhraseSetRequest
Mensaje de solicitud del método UpdatePhraseSet.
| Campos | |
|---|---|
phrase_set |
Obligatorio. El objeto PhraseSet que se va a actualizar. El campo |
update_mask |
Lista de campos que se van a actualizar. Si está vacío, se tendrán en cuenta todos los campos con valores no predeterminados para la actualización. Usa |
validate_only |
Si se define, valida la solicitud y muestra una vista previa del PhraseSet actualizado, pero no lo actualiza. |
UpdateRecognizerRequest
Mensaje de solicitud del método UpdateRecognizer.
| Campos | |
|---|---|
recognizer |
Obligatorio. El Recognizer que se va a actualizar. El campo |
update_mask |
Lista de campos que se van a actualizar. Si está vacío, se tendrán en cuenta todos los campos con valores no predeterminados para la actualización. Usa |
validate_only |
Si se define, valida la solicitud y muestra una vista previa del Recognizer actualizado, pero no lo actualiza. |
VttOutputFileFormatConfig
Este tipo no tiene campos.
Configuraciones de salida para archivos de subtítulos en formato WebVTT.
WordInfo
Información específica de la palabra para palabras reconocidas.
| Campos | |
|---|---|
start_offset |
Compensación horaria referente al comienzo del audio y correspondiente al inicio de la palabra hablada. Este campo solo se define si |
end_offset |
Compensación horaria referente al comienzo del audio y correspondiente al final de la palabra hablada. Este campo solo se define si |
word |
La palabra correspondiente a este conjunto de información. |
confidence |
La estimación de confianza se encuentra entre 0,0 y 1,0. Un número más alto indica una mayor probabilidad estimada de que las palabras reconocidas sean correctas. Este campo solo se define para la alternativa principal de un resultado que no es de streaming o de un resultado de streaming en el que |
speaker_label |
Se asigna una etiqueta diferente a cada interlocutor del audio. Este campo especifica cuál de esos interlocutores se ha detectado que ha pronunciado esta palabra. |