Package google.cloud.speech.v2

Índice

Voz

Permite la transcripción de voz y la gestión de recursos.

BatchRecognize

rpc BatchRecognize(BatchRecognizeRequest) returns (Operation)

Realiza el reconocimiento de voz asíncrono por lotes: envía una solicitud con N archivos de audio y recibe una operación de larga duración que se puede sondear para ver cuándo terminan las transcripciones.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

Permisos de IAM

Requiere el siguiente permiso de gestión de identidades y accesos en el recurso recognizer:

  • speech.recognizers.recognize

Para obtener más información, consulta la documentación de gestión de identidades y accesos.

CreateCustomClass

rpc CreateCustomClass(CreateCustomClassRequest) returns (Operation)

Crea un CustomClass.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

Permisos de IAM

Requiere el siguiente permiso de gestión de identidades y accesos en el recurso parent:

  • speech.customClasses.create

Para obtener más información, consulta la documentación de gestión de identidades y accesos.

CreatePhraseSet

rpc CreatePhraseSet(CreatePhraseSetRequest) returns (Operation)

Crea un PhraseSet.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

Permisos de IAM

Requiere el siguiente permiso de gestión de identidades y accesos en el recurso parent:

  • speech.phraseSets.create

Para obtener más información, consulta la documentación de gestión de identidades y accesos.

CreateRecognizer

rpc CreateRecognizer(CreateRecognizerRequest) returns (Operation)

Crea un Recognizer.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

Permisos de IAM

Requiere el siguiente permiso de gestión de identidades y accesos en el recurso parent:

  • speech.recognizers.create

Para obtener más información, consulta la documentación de gestión de identidades y accesos.

DeleteCustomClass

rpc DeleteCustomClass(DeleteCustomClassRequest) returns (Operation)

Elimina el CustomClass.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

Permisos de IAM

Requiere el siguiente permiso de gestión de identidades y accesos en el recurso name:

  • speech.customClasses.delete

Para obtener más información, consulta la documentación de gestión de identidades y accesos.

DeletePhraseSet

rpc DeletePhraseSet(DeletePhraseSetRequest) returns (Operation)

Elimina el PhraseSet.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

Permisos de IAM

Requiere el siguiente permiso de gestión de identidades y accesos en el recurso name:

  • speech.phraseSets.delete

Para obtener más información, consulta la documentación de gestión de identidades y accesos.

DeleteRecognizer

rpc DeleteRecognizer(DeleteRecognizerRequest) returns (Operation)

Elimina el Recognizer.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

Permisos de IAM

Requiere el siguiente permiso de gestión de identidades y accesos en el recurso name:

  • speech.recognizers.delete

Para obtener más información, consulta la documentación de gestión de identidades y accesos.

GetConfig

rpc GetConfig(GetConfigRequest) returns (Config)

Devuelve el Config solicitado.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

Permisos de IAM

Requiere el siguiente permiso de gestión de identidades y accesos en el recurso name:

  • speech.config.get

Para obtener más información, consulta la documentación de gestión de identidades y accesos.

GetCustomClass

rpc GetCustomClass(GetCustomClassRequest) returns (CustomClass)

Devuelve el CustomClass solicitado.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

Permisos de IAM

Requiere el siguiente permiso de gestión de identidades y accesos en el recurso name:

  • speech.customClasses.get

Para obtener más información, consulta la documentación de gestión de identidades y accesos.

GetPhraseSet

rpc GetPhraseSet(GetPhraseSetRequest) returns (PhraseSet)

Devuelve el PhraseSet solicitado.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

Permisos de IAM

Requiere el siguiente permiso de gestión de identidades y accesos en el recurso name:

  • speech.phraseSets.get

Para obtener más información, consulta la documentación de gestión de identidades y accesos.

GetRecognizer

rpc GetRecognizer(GetRecognizerRequest) returns (Recognizer)

Devuelve el Recognizer solicitado. Falla con NOT_FOUND si el reconocedor solicitado no existe.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

Permisos de IAM

Requiere el siguiente permiso de gestión de identidades y accesos en el recurso name:

  • speech.recognizers.get

Para obtener más información, consulta la documentación de gestión de identidades y accesos.

ListCustomClasses

rpc ListCustomClasses(ListCustomClassesRequest) returns (ListCustomClassesResponse)

Muestra CustomClasses.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

Permisos de IAM

Requiere el siguiente permiso de gestión de identidades y accesos en el recurso parent:

  • speech.customClasses.list

Para obtener más información, consulta la documentación de gestión de identidades y accesos.

ListPhraseSets

rpc ListPhraseSets(ListPhraseSetsRequest) returns (ListPhraseSetsResponse)

Muestra los PhraseSets.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

Permisos de IAM

Requiere el siguiente permiso de gestión de identidades y accesos en el recurso parent:

  • speech.phraseSets.list

Para obtener más información, consulta la documentación de gestión de identidades y accesos.

ListRecognizers

rpc ListRecognizers(ListRecognizersRequest) returns (ListRecognizersResponse)

Muestra los reconocedores.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

Permisos de IAM

Requiere el siguiente permiso de gestión de identidades y accesos en el recurso parent:

  • speech.recognizers.list

Para obtener más información, consulta la documentación de gestión de identidades y accesos.

Reconocer

rpc Recognize(RecognizeRequest) returns (RecognizeResponse)

Realiza el reconocimiento de voz síncrono: recibe los resultados después de que se haya enviado y procesado todo el audio.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

Permisos de IAM

Requiere el siguiente permiso de gestión de identidades y accesos en el recurso recognizer:

  • speech.recognizers.recognize

Para obtener más información, consulta la documentación de gestión de identidades y accesos.

StreamingRecognize

rpc StreamingRecognize(StreamingRecognizeRequest) returns (StreamingRecognizeResponse)

Realiza reconocimiento de voz bidireccional en streaming: recibe los resultados mientras se envía el audio. Este método solo está disponible a través de la API gRPC (no REST).

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

Permisos de IAM

Requiere el siguiente permiso de gestión de identidades y accesos en el recurso recognizer:

  • speech.recognizers.recognize

Para obtener más información, consulta la documentación de gestión de identidades y accesos.

UndeleteCustomClass

rpc UndeleteCustomClass(UndeleteCustomClassRequest) returns (Operation)

Anula la eliminación del CustomClass.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

Permisos de IAM

Requiere el siguiente permiso de gestión de identidades y accesos en el recurso name:

  • speech.customClasses.undelete

Para obtener más información, consulta la documentación de gestión de identidades y accesos.

UndeletePhraseSet

rpc UndeletePhraseSet(UndeletePhraseSetRequest) returns (Operation)

Anula la eliminación del PhraseSet.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

Permisos de IAM

Requiere el siguiente permiso de gestión de identidades y accesos en el recurso name:

  • speech.phraseSets.undelete

Para obtener más información, consulta la documentación de gestión de identidades y accesos.

UndeleteRecognizer

rpc UndeleteRecognizer(UndeleteRecognizerRequest) returns (Operation)

Anula la eliminación del Recognizer.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

Permisos de IAM

Requiere el siguiente permiso de gestión de identidades y accesos en el recurso name:

  • speech.recognizers.undelete

Para obtener más información, consulta la documentación de gestión de identidades y accesos.

UpdateConfig

rpc UpdateConfig(UpdateConfigRequest) returns (Config)

Actualiza el Config.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

Permisos de IAM

Requiere el siguiente permiso de gestión de identidades y accesos en el recurso name:

  • speech.config.update

Para obtener más información, consulta la documentación de gestión de identidades y accesos.

UpdateCustomClass

rpc UpdateCustomClass(UpdateCustomClassRequest) returns (Operation)

Actualiza el CustomClass.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

Permisos de IAM

Requiere el siguiente permiso de gestión de identidades y accesos en el recurso name:

  • speech.customClasses.update

Para obtener más información, consulta la documentación de gestión de identidades y accesos.

UpdatePhraseSet

rpc UpdatePhraseSet(UpdatePhraseSetRequest) returns (Operation)

Actualiza el PhraseSet.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

Permisos de IAM

Requiere el siguiente permiso de gestión de identidades y accesos en el recurso name:

  • speech.phraseSets.update

Para obtener más información, consulta la documentación de gestión de identidades y accesos.

UpdateRecognizer

rpc UpdateRecognizer(UpdateRecognizerRequest) returns (Operation)

Actualiza el Recognizer.

Permisos de autorización

Requiere el siguiente permiso de OAuth:

  • https://www.googleapis.com/auth/cloud-platform

Para obtener más información, consulta el Authentication Overview.

Permisos de IAM

Requiere el siguiente permiso de gestión de identidades y accesos en el recurso name:

  • speech.recognizers.update

Para obtener más información, consulta la documentación de gestión de identidades y accesos.

AccessMetadata

Metadatos de acceso de una región concreta. Esto se puede aplicar si la política de la organización del proyecto en cuestión no permite una región concreta.

Campos
constraint_type

ConstraintType

Describe los diferentes tipos de restricciones que se aplican.

ConstraintType

Describe los diferentes tipos de restricciones que se pueden aplicar a una región.

Enumeraciones
CONSTRAINT_TYPE_UNSPECIFIED Se ha aplicado una restricción no especificada.
RESOURCE_LOCATIONS_ORG_POLICY_CREATE_CONSTRAINT La política de organización del proyecto no permite la región indicada.

AutoDetectDecodingConfig

Este tipo no tiene campos.

Parámetros de decodificación detectados automáticamente. Se admite en las siguientes codificaciones:

  • WAV_LINEAR16: muestras PCM little-endian de 16 bits con signo en un contenedor WAV.

  • WAV_MULAW: muestras mulaw comprimidas de 8 bits en un contenedor WAV.

  • WAV_ALAW: muestras alaw comprimidas de 8 bits en un contenedor WAV.

  • RFC4867_5_AMR: marcos AMR con un encabezado rfc4867.5.

  • RFC4867_5_AMRWB: marcos AMR-WB con un encabezado rfc4867.5.

  • FLAC: fotogramas FLAC en el formato de contenedor "FLAC nativo".

  • MP3: marcos de audio MPEG con metadatos ID3 opcionales (se ignoran).

  • OGG_OPUS: fotogramas de audio Opus en un contenedor Ogg.

  • WEBM_OPUS: fotogramas de audio Opus en un contenedor WebM.

  • MP4_AAC: fotogramas de audio AAC en un contenedor MP4.

  • M4A_AAC: fotogramas de audio AAC en un contenedor M4A.

  • MOV_AAC: fotogramas de audio AAC en un contenedor MOV.

BatchRecognizeFileMetadata

Metadatos sobre un solo archivo de un lote para BatchRecognize.

Campos
config

RecognitionConfig

Funciones y metadatos de audio que se van a usar para el reconocimiento automático del habla. Este campo, junto con el campo config_mask, se puede usar para anular partes del default_recognition_config del recurso Recognizer, así como el config a nivel de solicitud.

config_mask

FieldMask

Lista de campos de config que anulan los valores de default_recognition_config del reconocedor durante esta solicitud de reconocimiento. Si no se proporciona ninguna máscara, todos los campos con valores no predeterminados de config anularán los valores del reconocedor en esta solicitud de reconocimiento. Si se proporciona una máscara, solo los campos que se incluyan en ella anularán la configuración del reconocedor en esta solicitud de reconocimiento. Si se proporciona un comodín (*), config anula y sustituye por completo la configuración del reconocedor en esta solicitud de reconocimiento.

Campo de unión audio_source. La fuente de audio, que es un URI de Google Cloud Storage. audio_source solo puede ser una de estas dos opciones:
uri

string

URI de Cloud Storage del archivo de audio.

BatchRecognizeFileResult

Resultados finales de un solo archivo.

Campos
error

Status

Error si se ha producido alguno.

metadata

RecognitionResponseMetadata

uri
(deprecated)

string

Obsoleto. En su lugar, usa cloud_storage_result.native_format_uri.

transcript
(deprecated)

BatchRecognizeResults

Obsoleto. En su lugar, usa inline_result.transcript.

Campo de unión result.

result solo puede ser una de estas dos opciones:

cloud_storage_result

CloudStorageResult

Resultados del reconocimiento escritos en Cloud Storage. Este campo solo se rellena cuando se define GcsOutputConfig en [RecognitionOutputConfig][google.cloud.speech.v2.RecognitionOutputConfig.

inline_result

InlineResult

Resultados de reconocimiento. Este campo solo se rellena cuando se define InlineOutputConfig en [RecognitionOutputConfig][google.cloud.speech.v2.RecognitionOutputConfig.

BatchRecognizeMetadata

Metadatos de la operación de BatchRecognize.

Campos
transcription_metadata

map<string, BatchRecognizeTranscriptionMetadata>

Asigna el nombre de archivo proporcionado a los metadatos de transcripción de ese archivo.

BatchRecognizeRequest

Mensaje de solicitud del método BatchRecognize.

Campos
recognizer

string

Obligatorio. Nombre del Recognizer que se va a usar durante el reconocimiento. El formato esperado es projects/{project}/locations/{location}/recognizers/{recognizer}. El segmento {recognizer} se puede definir como _ para usar un Recognizer implícito vacío.

config

RecognitionConfig

Funciones y metadatos de audio que se van a usar para el reconocimiento automático del habla. Este campo, junto con el campo config_mask, se puede usar para anular partes del default_recognition_config del recurso Recognizer.

config_mask

FieldMask

Lista de campos de config que anulan los valores de default_recognition_config del reconocedor durante esta solicitud de reconocimiento. Si no se proporciona ninguna máscara, todos los campos de config anularán los valores del reconocedor en esta solicitud de reconocimiento. Si se proporciona una máscara, solo los campos que se incluyan en ella anularán la configuración del reconocedor en esta solicitud de reconocimiento. Si se proporciona un comodín (*), config anula y sustituye por completo la configuración del reconocedor en esta solicitud de reconocimiento.

files[]

BatchRecognizeFileMetadata

Archivos de audio con metadatos de archivo para el reconocimiento automático del habla. Se pueden especificar un máximo de 15 archivos.

recognition_output_config

RecognitionOutputConfig

Opciones de configuración para determinar dónde se generarán las transcripciones de cada archivo.

processing_strategy

ProcessingStrategy

Estrategia de procesamiento que se va a usar en esta solicitud.

ProcessingStrategy

Posibles estrategias de procesamiento para solicitudes por lotes.

Enumeraciones
PROCESSING_STRATEGY_UNSPECIFIED Valor predeterminado de la estrategia de procesamiento. La solicitud se procesa en cuanto se recibe.
DYNAMIC_BATCHING Si se selecciona, procesa la solicitud durante los periodos de menor utilización para obtener un descuento. La solicitud se completa en un plazo de 24 horas.

BatchRecognizeResponse

Mensaje de respuesta de BatchRecognize que se empaqueta en un Operation de larga duración.

Campos
results

map<string, BatchRecognizeFileResult>

Asigna el nombre de archivo al resultado final de ese archivo.

total_billed_duration

Duration

Cuando esté disponible, los segundos de audio facturados de la solicitud correspondiente.

BatchRecognizeResults

Tipo de salida de Cloud Storage de las transcripciones de BatchRecognize. Aunque este archivo proto no se devuelve en ninguna parte de esta API, las transcripciones de Cloud Storage se serializarán en este archivo proto y se deben analizar como tal.

Campos
results[]

SpeechRecognitionResult

Lista secuencial de resultados de transcripción correspondientes a partes secuenciales de audio.

metadata

RecognitionResponseMetadata

Metadatos sobre el reconocimiento.

BatchRecognizeTranscriptionMetadata

Metadatos sobre la transcripción de un solo archivo (por ejemplo, el porcentaje de progreso).

Campos
progress_percent

int32

Cuánto del archivo se ha transcrito hasta el momento.

error

Status

Error si se ha producido alguno.

uri

string

El URI de Cloud Storage en el que se escribirán los resultados del reconocimiento.

CloudStorageResult

Los resultados finales se escriben en Cloud Storage.

Campos
uri

string

El URI de Cloud Storage en el que se escribieron los resultados del reconocimiento.

vtt_format_uri

string

El URI de Cloud Storage en el que se escribieron los resultados del reconocimiento como subtítulos con formato VTT. Este campo solo se rellena cuando se solicita la salida VTT.

srt_format_uri

string

El URI de Cloud Storage en el que se escribieron los resultados del reconocimiento como subtítulos con formato SRT. Este campo solo se rellena cuando se solicita la salida SRT.

Configuración

Mensaje que representa la configuración de la API Speech-to-Text. Esto incluye una clave de KMS opcional con la que se cifrarán los datos entrantes.

Campos
name

string

Solo de salida. Identificador. Nombre del recurso de configuración. Hay exactamente un recurso de configuración por proyecto y por ubicación. El formato esperado es projects/{project}/locations/{location}/config.

kms_key_name

string

Opcional. Un nombre de clave de KMS opcional que, si se proporciona, se usará para cifrar los recursos de Speech-to-Text en reposo. Al actualizar esta clave, no se cifrarán los recursos que ya la usen. Solo se cifrarán los recursos nuevos. El formato esperado es projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

update_time

Timestamp

Solo de salida. La hora más reciente en la que se modificó este recurso.

CreateCustomClassRequest

Mensaje de solicitud del método CreateCustomClass.

Campos
custom_class

CustomClass

Obligatorio. CustomClass que se va a crear.

validate_only

bool

Si se define, valida la solicitud y muestra una vista previa de CustomClass, pero no la crea.

custom_class_id

string

ID que se va a usar en CustomClass, que se convertirá en el componente final del nombre de recurso de CustomClass.

Este valor debe tener entre 4 y 63 caracteres, y los caracteres válidos son /[a-z][0-9]-/.

parent

string

Obligatorio. El proyecto y la ubicación en los que se creará este CustomClass. El formato esperado es projects/{project}/locations/{location}.

CreatePhraseSetRequest

Mensaje de solicitud del método CreatePhraseSet.

Campos
phrase_set

PhraseSet

Obligatorio. PhraseSet que se va a crear.

validate_only

bool

Si se define, valida la solicitud y muestra una vista previa de PhraseSet, pero no la crea.

phrase_set_id

string

ID que se va a usar en el PhraseSet, que se convertirá en el componente final del nombre del recurso de PhraseSet.

Este valor debe tener entre 4 y 63 caracteres, y los caracteres válidos son /[a-z][0-9]-/.

parent

string

Obligatorio. Proyecto y ubicación en los que se creará este PhraseSet. El formato esperado es projects/{project}/locations/{location}.

CreateRecognizerRequest

Mensaje de solicitud del método CreateRecognizer.

Campos
recognizer

Recognizer

Obligatorio. El Recognizer que se va a crear.

validate_only

bool

Si se define, valida la solicitud y previsualiza el Recognizer, pero no lo crea.

recognizer_id

string

ID que se va a usar en el Recognizer, que se convertirá en el componente final del nombre de recurso del Recognizer.

Este valor debe tener entre 4 y 63 caracteres, y los caracteres válidos son /[a-z][0-9]-/.

parent

string

Obligatorio. El proyecto y la ubicación en los que se creará este Recognizer. El formato esperado es projects/{project}/locations/{location}.

CustomClass

CustomClass para sesgos en el reconocimiento de voz. Se usa para definir un conjunto de palabras o frases que representan un concepto o un tema comunes que es probable que aparezcan en tu audio. Por ejemplo, una lista de nombres de barcos de pasajeros.

Campos
name

string

Solo de salida. Identificador. Nombre de recurso de CustomClass. Formato: projects/{project}/locations/{location}/customClasses/{custom_class}.

uid

string

Solo de salida. Identificador único asignado por el sistema a CustomClass.

display_name

string

Opcional. Nombre legible por humanos que se puede definir para CustomClass. Debe tener 63 caracteres como máximo.

items[]

ClassItem

Colección de elementos de clase.

state

State

Solo de salida. El estado del ciclo de vida de CustomClass.

create_time

Timestamp

Solo de salida. Hora de creación.

update_time

Timestamp

Solo de salida. La hora más reciente en la que se modificó este recurso.

delete_time

Timestamp

Solo de salida. Hora a la que se solicitó la eliminación de este recurso.

expire_time

Timestamp

Solo de salida. La hora a la que se purgará este recurso.

annotations

map<string, string>

Opcional. Permite a los usuarios almacenar pequeñas cantidades de datos arbitrarios. Tanto la clave como el valor deben tener 63 caracteres como máximo. Un máximo de 100 anotaciones.

etag

string

Solo de salida. El servidor calcula esta suma de comprobación en función del valor de otros campos. Puede enviarse en solicitudes de actualización, restauración y eliminación para asegurarse de que el cliente tenga un valor actualizado antes de continuar.

reconciling

bool

Solo de salida. Indica si se está actualizando esta CustomClass.

kms_key_name

string

Solo de salida. El nombre de la clave de KMS con la que se encripta CustomClass. El formato esperado es projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

kms_key_version_name

string

Solo de salida. El nombre de la versión de la clave de KMS con la que se cifra CustomClass. El formato esperado es projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}/cryptoKeyVersions/{crypto_key_version}.

ClassItem

Un elemento de la clase.

Campos
value

string

Valor del elemento de clase.

Estado

Conjunto de estados que definen el ciclo de vida de un CustomClass.

Enumeraciones
STATE_UNSPECIFIED Estado sin especificar. Solo se usa o es útil para distinguir los valores no definidos.
ACTIVE El estado normal y el estado activo.
DELETED Se ha eliminado este CustomClass.

DeleteCustomClassRequest

Mensaje de solicitud del método DeleteCustomClass.

Campos
name

string

Obligatorio. Nombre del CustomClass que se va a eliminar. Formato: projects/{project}/locations/{location}/customClasses/{custom_class}

validate_only

bool

Si se define, valida la solicitud y muestra una vista previa de la CustomClass eliminada, pero no la elimina.

allow_missing

bool

Si se le asigna el valor true y no se encuentra CustomClass, la solicitud se completará correctamente y no se realizará ninguna operación (en este caso, no se registrará ninguna operación).

etag

string

El servidor calcula esta suma de comprobación en función del valor de otros campos. Puede enviarse en solicitudes de actualización, restauración y eliminación para asegurarse de que el cliente tenga un valor actualizado antes de continuar.

DeletePhraseSetRequest

Mensaje de solicitud del método DeletePhraseSet.

Campos
name

string

Obligatorio. Nombre del objeto PhraseSet que se va a eliminar. Formato: projects/{project}/locations/{location}/phraseSets/{phrase_set}

validate_only

bool

Si se define, valida la solicitud y muestra una vista previa del objeto PhraseSet eliminado, pero no lo elimina.

allow_missing

bool

Si se le asigna el valor true y no se encuentra el PhraseSet, la solicitud se completará correctamente y no se realizará ninguna operación (en este caso, no se registrará ninguna operación).

etag

string

El servidor calcula esta suma de comprobación en función del valor de otros campos. Puede enviarse en solicitudes de actualización, restauración y eliminación para asegurarse de que el cliente tenga un valor actualizado antes de continuar.

DeleteRecognizerRequest

Mensaje de solicitud del método DeleteRecognizer.

Campos
name

string

Obligatorio. Nombre del Recognizer que se va a eliminar. Formato: projects/{project}/locations/{location}/recognizers/{recognizer}

validate_only

bool

Si se define, valida la solicitud y muestra una vista previa del Recognizer eliminado, pero no lo elimina.

allow_missing

bool

Si se le asigna el valor true y no se encuentra el Recognizer, la solicitud se completará correctamente y no se realizará ninguna operación (no se registrará ninguna operación en este caso).

etag

string

El servidor calcula esta suma de comprobación en función del valor de otros campos. Puede enviarse en solicitudes de actualización, restauración y eliminación para asegurarse de que el cliente tenga un valor actualizado antes de continuar.

DenoiserConfig

Configuración de reducción de ruido. Puede que no sea compatible con todos los modelos y que no tenga ningún efecto.

Campos
denoise_audio

bool

Elimina el ruido del audio antes de enviarlo al modelo de transcripción.

snr_threshold

float

Umbral de la relación señal/ruido (SNR) del eliminador de ruido. En este caso, SNR significa la intensidad de la señal de voz. El audio con una relación señal/ruido inferior a este umbral, lo que significa que la voz es demasiado baja, no se enviará al modelo de transcripción.

Si snr_threshold=0, no se aplicará ningún filtro.

ExplicitDecodingConfig

Parámetros de decodificación especificados explícitamente.

Campos
encoding

AudioEncoding

Obligatorio. Codificación de los datos de audio enviados para el reconocimiento.

sample_rate_hertz

int32

Opcional. Frecuencia de muestreo en hercios de los datos de audio enviados para el reconocimiento. Los valores válidos son de 8000 a 48000, y 16000 es el valor óptimo. Para obtener los mejores resultados, define la frecuencia de muestreo de la fuente de audio en 16.000 Hz. Si no es posible, usa la frecuencia de muestreo nativa de la fuente de audio (en lugar de remuestrear). Ten en cuenta que este campo está marcado como OPCIONAL por motivos de retrocompatibilidad. Es (y siempre ha sido) OBLIGATORIO.

audio_channel_count

int32

Opcional. Número de canales presentes en los datos de audio enviados para el reconocimiento. Ten en cuenta que este campo está marcado como OPCIONAL por motivos de retrocompatibilidad. Es (y siempre ha sido) OBLIGATORIO.

El valor máximo permitido es 8.

AudioEncoding

Codificaciones de datos de audio admitidas.

Enumeraciones
AUDIO_ENCODING_UNSPECIFIED Valor predeterminado. Este valor no se usa.
LINEAR16 Muestras PCM de 16 bits con signo y orden de bytes menor, sin encabezado.
MULAW Muestras de ley mu compuestas de 8 bits sin encabezado.
ALAW Muestras de alaw comprimidas de 8 bits sin encabezado.
AMR Marcos AMR con un encabezado rfc4867.5.
AMR_WB Marcos AMR-WB con un encabezado rfc4867.5.
FLAC Marcos FLAC en el formato de contenedor "FLAC nativo".
MP3 Marcos de audio MPEG con metadatos ID3 opcionales (se ignoran).
OGG_OPUS Tramas de audio Opus en un contenedor Ogg.
WEBM_OPUS Marcos de audio Opus en un contenedor WebM.
MP4_AAC Tramas de audio AAC en un contenedor MP4.
M4A_AAC Tramas de audio AAC en un contenedor M4A.
MOV_AAC Tramas de audio AAC en un contenedor MOV.

GcsOutputConfig

Configuraciones de salida de Cloud Storage.

Campos
uri

string

El prefijo del URI de Cloud Storage con el que se escribirán los resultados del reconocimiento.

GetConfigRequest

Mensaje de solicitud del método GetConfig.

Campos
name

string

Obligatorio. Nombre de la configuración que se va a obtener. Hay exactamente un recurso de configuración por proyecto y por ubicación. El formato esperado es projects/{project}/locations/{location}/config.

GetCustomClassRequest

Mensaje de solicitud del método GetCustomClass.

Campos
name

string

Obligatorio. Nombre de la CustomClass que se va a obtener. El formato esperado es projects/{project}/locations/{location}/customClasses/{custom_class}.

GetPhraseSetRequest

Mensaje de solicitud del método GetPhraseSet.

Campos
name

string

Obligatorio. Nombre del PhraseSet que se va a obtener. El formato esperado es projects/{project}/locations/{location}/phraseSets/{phrase_set}.

GetRecognizerRequest

Mensaje de solicitud del método GetRecognizer.

Campos
name

string

Obligatorio. Nombre del Recognizer que se va a obtener. El formato esperado es projects/{project}/locations/{location}/recognizers/{recognizer}.

InlineOutputConfig

Este tipo no tiene campos.

Configuraciones de salida de la respuesta insertada.

InlineResult

Resultados finales devueltos en línea en la respuesta de reconocimiento.

Campos
transcript

BatchRecognizeResults

La transcripción del archivo de audio.

vtt_captions

string

La transcripción del archivo de audio en formato VTT. Este campo solo se rellena cuando se solicita la salida VTT.

srt_captions

string

La transcripción del archivo de audio en formato SRT. Este campo solo se rellena cuando se solicita la salida SRT.

LanguageMetadata

Los metadatos sobre las configuraciones regionales disponibles en una región determinada. Actualmente, solo se muestran los modelos disponibles para cada configuración regional.

Campos
models

map<string, ModelMetadata>

Mapa de configuración regional (código de idioma) -> modelos

ListCustomClassesRequest

Mensaje de solicitud del método ListCustomClasses.

Campos
parent

string

Obligatorio. El proyecto y la ubicación de los recursos CustomClass que se van a enumerar. El formato esperado es projects/{project}/locations/{location}.

page_size

int32

Número de resultados por solicitud. El valor de page_size debe estar comprendido entre 0 y 100 (ambos incluidos). Si el valor de page_size es cero o no se especifica, se elegirá un tamaño de página de 5. Si el tamaño de página supera las 100, se reducirá a 100. Ten en cuenta que una llamada puede devolver menos resultados que el tamaño de página solicitado.

page_token

string

Token de página recibido de una llamada ListCustomClasses anterior. Proporciona este elemento para obtener la siguiente página.

Al hacer la paginación, todos los demás parámetros proporcionados a ListCustomClasses deben ser los mismos que aparecen en la llamada que proporcionó el token de la página.

show_deleted

bool

Indica si se deben mostrar los recursos que se han eliminado.

ListCustomClassesResponse

Mensaje de respuesta del método ListCustomClasses.

Campos
custom_classes[]

CustomClass

Lista de CustomClasses solicitadas.

next_page_token

string

Token que se puede enviar como page_token para obtener la siguiente página. Si se omite este campo, no hay páginas posteriores. Este token caduca al cabo de 72 horas.

ListPhraseSetsRequest

Mensaje de solicitud del método ListPhraseSets.

Campos
parent

string

Obligatorio. El proyecto y la ubicación de los recursos de PhraseSet que se van a enumerar. El formato esperado es projects/{project}/locations/{location}.

page_size

int32

Número máximo de PhraseSets que se devolverán. Es posible que el servicio devuelva un número inferior a este valor. Si no se especifica, se devolverán 5 PhraseSets como máximo. El valor máximo es 100; los valores superiores a este límite se convertirán a 100.

page_token

string

Token de página recibido de una llamada ListPhraseSets anterior. Proporciona este elemento para obtener la siguiente página.

Al hacer la paginación, todos los demás parámetros proporcionados a ListPhraseSets deben ser los mismos que aparecen en la llamada que proporcionó el token de la página.

show_deleted

bool

Indica si se deben mostrar los recursos que se han eliminado.

ListPhraseSetsResponse

Mensaje de respuesta del método ListPhraseSets.

Campos
phrase_sets[]

PhraseSet

Lista de PhraseSets solicitados.

next_page_token

string

Token que se puede enviar como page_token para obtener la siguiente página. Si se omite este campo, no hay páginas posteriores. Este token caduca al cabo de 72 horas.

ListRecognizersRequest

Mensaje de solicitud del método ListRecognizers.

Campos
parent

string

Obligatorio. El proyecto y la ubicación de los reconocedores que se van a enumerar. El formato esperado es projects/{project}/locations/{location}.

page_size

int32

Número máximo de Recognizers que se devolverán. Es posible que el servicio devuelva un número inferior a este valor. Si no se especifica, se devolverán 5 Recognizers como máximo. El valor máximo es 100; los valores superiores a este límite se convertirán a 100.

page_token

string

Token de página recibido de una llamada ListRecognizers anterior. Proporciona este elemento para obtener la siguiente página.

Al hacer la paginación, todos los demás parámetros proporcionados a ListRecognizers deben ser los mismos que aparecen en la llamada que proporcionó el token de la página.

show_deleted

bool

Indica si se deben mostrar los recursos que se han eliminado.

ListRecognizersResponse

Mensaje de respuesta del método ListRecognizers.

Campos
recognizers[]

Recognizer

Lista de Recognizers solicitados.

next_page_token

string

Token que se puede enviar como page_token para obtener la siguiente página. Si se omite este campo, no hay páginas posteriores. Este token caduca al cabo de 72 horas.

LocationsMetadata

Metadatos principales de la API Locations de STT V2. Actualmente, solo se trata de los metadatos sobre las configuraciones regionales, los modelos y las funciones.

Campos
languages

LanguageMetadata

Información sobre las configuraciones regionales, los modelos y las funciones disponibles representados en la estructura jerárquica de configuraciones regionales, modelos y funciones

access_metadata

AccessMetadata

Información sobre los metadatos de acceso de la región y el proyecto en cuestión.

ModelFeature

Representa una función singular de un modelo. Si la función es recognizer, el valor de release_state de la función representa el valor de release_state del modelo.

Campos
feature

string

El nombre de la función (nota: la función puede ser recognizer)

release_state

string

El estado de lanzamiento de la función

ModelFeatures

Representa la colección de funciones que pertenecen a un modelo.

Campos
model_feature[]

ModelFeature

Campo repetido que contiene todas las características del modelo.

ModelMetadata

Los metadatos sobre los modelos de una región determinada para una configuración regional específica. Actualmente, solo se muestran las funciones del modelo

Campos
model_features

map<string, ModelFeatures>

Mapa del nombre del modelo -> funciones de ese modelo

NativeOutputFileFormatConfig

Este tipo no tiene campos.

Configuraciones de salida para protos BatchRecognizeResults serializados.

OperationMetadata

Representa los metadatos de una operación de larga duración.

Campos
create_time

Timestamp

Hora en la que se creó la operación.

update_time

Timestamp

Hora a la que se actualizó la operación por última vez.

resource

string

Ruta del recurso de destino de la operación.

method

string

El método que ha activado la operación.

kms_key_name

string

El nombre de la clave del KMS con la que se cifra el contenido de la operación. El formato esperado es projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

kms_key_version_name

string

El nombre de la versión de la clave de KMS con la que se cifra el contenido de la operación. El formato esperado es projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}/cryptoKeyVersions/{crypto_key_version}.

progress_percent

int32

Porcentaje de progreso de la operación. Los valores pueden oscilar entre 0 y 100. Si el valor es 100, significa que la operación ha finalizado.

Campo de unión request. La solicitud que ha generado la operación. request solo puede ser una de estas dos opciones:
batch_recognize_request

BatchRecognizeRequest

BatchRecognizeRequest que ha generado la operación.

create_recognizer_request

CreateRecognizerRequest

CreateRecognizerRequest que ha generado la operación.

update_recognizer_request

UpdateRecognizerRequest

UpdateRecognizerRequest que ha generado la operación.

delete_recognizer_request

DeleteRecognizerRequest

DeleteRecognizerRequest que ha generado la operación.

undelete_recognizer_request

UndeleteRecognizerRequest

UndeleteRecognizerRequest que ha generado la operación.

create_custom_class_request

CreateCustomClassRequest

CreateCustomClassRequest que ha generado la operación.

update_custom_class_request

UpdateCustomClassRequest

UpdateCustomClassRequest que ha generado la operación.

delete_custom_class_request

DeleteCustomClassRequest

DeleteCustomClassRequest que ha generado la operación.

undelete_custom_class_request

UndeleteCustomClassRequest

UndeleteCustomClassRequest que ha generado la operación.

create_phrase_set_request

CreatePhraseSetRequest

CreatePhraseSetRequest que ha generado la operación.

update_phrase_set_request

UpdatePhraseSetRequest

UpdatePhraseSetRequest que ha generado la operación.

delete_phrase_set_request

DeletePhraseSetRequest

DeletePhraseSetRequest que ha generado la operación.

undelete_phrase_set_request

UndeletePhraseSetRequest

UndeletePhraseSetRequest que ha generado la operación.

update_config_request
(deprecated)

UpdateConfigRequest

UpdateConfigRequest que ha generado la operación.

Campo de unión metadata. Metadatos específicos por RPC. metadata solo puede ser una de estas dos opciones:
batch_recognize_metadata

BatchRecognizeMetadata

Metadatos específicos del método BatchRecognize.

OutputFormatConfig

Configuración del formato de los resultados almacenados en output.

Campos
native

NativeOutputFileFormatConfig

Configuración del formato de salida nativo. Si se define este campo o no se define ningún otro campo de formato de salida, las transcripciones se escribirán en el receptor en el formato nativo.

vtt

VttOutputFileFormatConfig

Configuración del formato de salida VTT. Si se define este campo, las transcripciones se escribirán en el receptor en formato VTT.

srt

SrtOutputFileFormatConfig

Configuración del formato de salida SRT. Si se define este campo, las transcripciones se escribirán en el sumidero en formato SRT.

PhraseSet

PhraseSet para sesgos en el reconocimiento de voz. Un PhraseSet se usa para proporcionar "sugerencias" al reconocedor de voz para que favorezca palabras y frases específicas en los resultados.

Campos
name

string

Solo de salida. Identificador. Nombre de recurso de PhraseSet. Formato: projects/{project}/locations/{location}/phraseSets/{phrase_set}.

uid

string

Solo de salida. Identificador único asignado por el sistema al objeto PhraseSet.

phrases[]

Phrase

Una lista de palabras y frases.

boost

float

Pista. Un valor positivo aumentará la probabilidad de que se reconozca una frase específica en lugar de otras frases que suenen de forma similar. Cuanto mayor sea el aumento, mayor será la probabilidad de que se produzcan falsos positivos. Los valores válidos de boost están comprendidos entre 0 (excluido) y 20. Te recomendamos que uses una búsqueda binaria para encontrar el valor óptimo de tu caso práctico, así como que añadas frases con y sin refuerzo a tus solicitudes.

display_name

string

Nombre legible por humanos que puede definir el usuario para el PhraseSet. Debe tener 63 caracteres como máximo.

state

State

Solo de salida. El estado del ciclo de vida de PhraseSet.

create_time

Timestamp

Solo de salida. Hora de creación.

update_time

Timestamp

Solo de salida. La hora más reciente en la que se modificó este recurso.

delete_time

Timestamp

Solo de salida. Hora a la que se solicitó la eliminación de este recurso.

expire_time

Timestamp

Solo de salida. La hora a la que se purgará este recurso.

annotations

map<string, string>

Permite a los usuarios almacenar pequeñas cantidades de datos arbitrarios. Tanto la clave como el valor deben tener 63 caracteres como máximo. Un máximo de 100 anotaciones.

etag

string

Solo de salida. El servidor calcula esta suma de comprobación en función del valor de otros campos. Puede enviarse en solicitudes de actualización, restauración y eliminación para asegurarse de que el cliente tenga un valor actualizado antes de continuar.

reconciling

bool

Solo de salida. Indica si este PhraseSet se está actualizando o no.

kms_key_name

string

Solo de salida. El nombre de la clave de KMS con el que se cifra el PhraseSet. El formato esperado es projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

kms_key_version_name

string

Solo de salida. El nombre de la versión de la clave de KMS con la que se cifra el PhraseSet. El formato esperado es projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}/cryptoKeyVersions/{crypto_key_version}.

Frase

Una frase contiene palabras y "sugerencias" de frases para que el reconocimiento de voz tenga más probabilidades de reconocerlas. Esto se puede utilizar para mejorar la precisión de palabras y frases específicas, por ejemplo, si el usuario suele pronunciar comandos específicos. Esto también se puede usar para agregar palabras adicionales al vocabulario del reconocedor.

Los elementos de lista también pueden incluir referencias CustomClass que contengan grupos de palabras que representen conceptos comunes que se dan en el lenguaje natural.

Campos
value

string

La frase en sí.

boost

float

Pista. Anula el refuerzo definido a nivel de conjunto de frases. Un valor positivo aumentará la probabilidad de que se reconozca una frase específica en lugar de otras frases que suenen de forma similar. Cuanto mayor sea el aumento, mayor será la probabilidad de que se produzcan falsos positivos. Los valores de impulso negativos se corresponderían con la eliminación de sesgos. El ajuste para evitar sesgos no está habilitado, por lo que los valores de impulso negativos devolverán un error. Los valores de impulso deben estar comprendidos entre 0 y 20. Cualquier valor fuera de ese intervalo devolverá un error. Te recomendamos que uses una búsqueda binaria para encontrar el valor óptimo de tu caso práctico, así como que añadas frases con y sin refuerzo a tus solicitudes.

Estado

Conjunto de estados que definen el ciclo de vida de un PhraseSet.

Enumeraciones
STATE_UNSPECIFIED Estado sin especificar. Solo se usa o es útil para distinguir los valores no definidos.
ACTIVE El estado normal y el estado activo.
DELETED Se ha eliminado este PhraseSet.

RecognitionConfig

Proporciona información al Recognizer que especifica cómo procesar la solicitud de reconocimiento.

Campos
model

string

Opcional. Qué modelo se debe usar para las solicitudes de reconocimiento. Selecciona el modelo que mejor se adapte a tu dominio para obtener los mejores resultados.

Puedes consultar las directrices para elegir el modelo que vas a usar en la documentación de los modelos de transcripción y los modelos admitidos en cada región en la tabla de modelos admitidos.

language_codes[]

string

Opcional. El idioma del audio proporcionado como etiqueta de idioma BCP-47. Las etiquetas de idioma se normalizan a BCP-47 antes de usarse. Por ejemplo, "en-us" se convierte en "en-US".

Los idiomas admitidos para cada modelo se indican en la tabla de modelos admitidos.

Si se proporcionan idiomas adicionales, el resultado del reconocimiento contendrá el reconocimiento en el idioma detectado más probable. El resultado del reconocimiento incluirá la etiqueta de idioma del idioma detectado en el audio.

features

RecognitionFeatures

Funciones de reconocimiento de voz que se van a habilitar.

adaptation

SpeechAdaptation

Contexto de adaptación del habla que pondera las predicciones del reconocedor para palabras y frases específicas.

transcript_normalization

TranscriptNormalization

Opcional. Usa la normalización de la transcripción para sustituir automáticamente partes de la transcripción por las frases que elijas. En el caso de StreamingRecognize, esta normalización solo se aplica a las transcripciones parciales estables (estabilidad > 0,8) y a las transcripciones finales.

translation_config

TranslationConfig

Opcional. Configuración opcional que se usa para ejecutar automáticamente la traducción del audio proporcionado al idioma deseado en los modelos admitidos.

denoiser_config

DenoiserConfig

Opcional. Configuración opcional de la función de reducción de ruido. Puede que no sea compatible con todos los modelos y que no tenga ningún efecto.

Campo de unión decoding_config. Parámetros de decodificación del audio que se envía para el reconocimiento. decoding_config solo puede ser una de estas dos opciones:
auto_decoding_config

AutoDetectDecodingConfig

Detectar automáticamente los parámetros de decodificación. Se prefiere para los formatos admitidos.

explicit_decoding_config

ExplicitDecodingConfig

Parámetros de decodificación especificados explícitamente. Obligatorio si se usa audio PCM sin encabezado (linear16, mulaw, alaw).

RecognitionFeatures

Funciones de reconocimiento disponibles.

Campos
profanity_filter

bool

Si se define como true, el servidor intentará filtrar las palabras malsonantes y sustituirá todos los caracteres de cada palabra filtrada, excepto el inicial, por asteriscos (por ejemplo, "f***"). Si se asigna el valor false o se omite, no se filtrarán las palabras malsonantes.

enable_word_time_offsets

bool

Si true, el primer resultado incluye una lista de palabras y los desplazamientos de hora de inicio y finalización (marcas de tiempo) de esas palabras. Si false, no se devuelve información sobre el desfase de tiempo a nivel de palabra. El valor predeterminado es false.

enable_word_confidence

bool

Si true, el primer resultado incluye una lista de palabras y la confianza de esas palabras. Si es false, no se devuelve información sobre la confianza a nivel de palabra. El valor predeterminado es false.

enable_automatic_punctuation

bool

Si true, añade signos de puntuación a las hipótesis de los resultados del reconocimiento. Esta función solo está disponible en algunos idiomas. El valor predeterminado false no añade signos de puntuación a las hipótesis de resultados.

enable_spoken_punctuation

bool

El comportamiento de la puntuación hablada de la llamada. Si true, sustituye la puntuación hablada por los símbolos correspondientes en la solicitud. Por ejemplo, "how are you question mark" (¿cómo estás?) se convierte en "how are you?" (¿cómo estás?). Consulta https://cloud.google.com/speech-to-text/docs/spoken-punctuation para obtener ayuda. Si false, no se sustituye la puntuación hablada.

enable_spoken_emojis

bool

El comportamiento de los emojis hablados en la llamada. Si el valor es true, se añade el formato de emoji hablado a la solicitud. De esta forma, los emojis que digas se sustituirán por los símbolos Unicode correspondientes en la transcripción final. Si false, los emojis hablados no se sustituyen.

multi_channel_mode

MultiChannelMode

Modo para reconocer audio multicanal.

diarization_config

SpeakerDiarizationConfig

Configuración para habilitar la diarización del interlocutor. Para habilitar la diarización, asigna a este campo un mensaje SpeakerDiarizationConfig vacío.

max_alternatives

int32

Número máximo de hipótesis de reconocimiento que se devolverán. Es posible que el servidor devuelva menos de max_alternatives. Los valores válidos son 0-30. Si se indica el valor 0 o 1, se devolverá un máximo de uno. Si se omite, devolverá un máximo de uno.

MultiChannelMode

Opciones para reconocer audio multicanal.

Enumeraciones
MULTI_CHANNEL_MODE_UNSPECIFIED Valor predeterminado del modo multicanal. Si el audio contiene varios canales, solo se transcribirá el primero. Los demás se ignorarán.
SEPARATE_RECOGNITION_PER_CHANNEL Si se selecciona esta opción, cada canal del audio proporcionado se transcribe de forma independiente. Esta opción no se puede seleccionar si el model seleccionado es latest_short.

RecognitionOutputConfig

Opciones de configuración de las salidas del reconocimiento.

Campos
output_format_config

OutputFormatConfig

Opcional. Configuración del formato de los resultados almacenados en output. Si no se especifica, las transcripciones se escribirán solo en formato NATIVE.

Campo de unión output.

output solo puede ser una de estas dos opciones:

gcs_output_config

GcsOutputConfig

Si este mensaje se rellena, los resultados del reconocimiento se escriben en el URI de Google Cloud Storage proporcionado.

inline_response_config

InlineOutputConfig

Si este mensaje se rellena, los resultados del reconocimiento se proporcionan en el mensaje BatchRecognizeResponse de la operación cuando se completa. Esta función solo se admite cuando se llama a BatchRecognize con un solo archivo de audio.

RecognitionResponseMetadata

Metadatos sobre la solicitud y la respuesta de reconocimiento.

Campos
request_id

string

Identificador de solicitud global generado automáticamente por la API.

total_billed_duration

Duration

Cuando esté disponible, los segundos de audio facturados de la solicitud correspondiente.

RecognizeRequest

Mensaje de solicitud del método Recognize. Se debe proporcionar content o uri. Si se proporcionan ambos o ninguno, se devuelve INVALID_ARGUMENT. Consulta los límites de contenido.

Campos
recognizer

string

Obligatorio. Nombre del Recognizer que se va a usar durante el reconocimiento. El formato esperado es projects/{project}/locations/{location}/recognizers/{recognizer}. El segmento {recognizer} se puede definir como _ para usar un Recognizer implícito vacío.

config

RecognitionConfig

Funciones y metadatos de audio que se van a usar para el reconocimiento automático del habla. Este campo, junto con el campo config_mask, se puede usar para anular partes del default_recognition_config del recurso Recognizer.

config_mask

FieldMask

Lista de campos de config que anulan los valores de default_recognition_config del reconocedor durante esta solicitud de reconocimiento. Si no se proporciona ninguna máscara, todos los campos con valores no predeterminados de config anularán los valores del reconocedor en esta solicitud de reconocimiento. Si se proporciona una máscara, solo los campos que se incluyan en ella anularán la configuración del reconocedor en esta solicitud de reconocimiento. Si se proporciona un comodín (*), config anula y sustituye por completo la configuración del reconocedor en esta solicitud de reconocimiento.

Campo de unión audio_source. La fuente de audio, que puede ser contenido insertado o un URI de Google Cloud Storage. audio_source solo puede ser una de estas dos opciones:
content

bytes

Los bytes de datos de audio codificados tal como se especifica en RecognitionConfig. Al igual que con todos los campos de bytes, los búferes de protocolo usan una representación binaria pura, mientras que las representaciones JSON usan base64.

uri

string

URI que apunta a un archivo que contiene bytes de datos de audio, tal como se especifica en RecognitionConfig. El archivo no debe estar comprimido (por ejemplo, con gzip). Actualmente, solo se admiten URIs de Google Cloud Storage, que deben especificarse en el siguiente formato: gs://bucket_name/object_name (otros formatos de URI devuelven INVALID_ARGUMENT). Para obtener más información, consulta URIs de solicitudes.

RecognizeResponse

Mensaje de respuesta del método Recognize.

Campos
results[]

SpeechRecognitionResult

Lista secuencial de resultados de transcripción correspondientes a partes secuenciales de audio.

metadata

RecognitionResponseMetadata

Metadatos sobre el reconocimiento.

Reconocedor

Un mensaje de Recognizer. Almacena la configuración y los metadatos del reconocimiento.

Campos
name

string

Solo de salida. Identificador. Nombre de recurso del Recognizer. Formato: projects/{project}/locations/{location}/recognizers/{recognizer}.

uid

string

Solo de salida. Identificador único asignado por el sistema al Recognizer.

display_name

string

Nombre legible por humanos que se puede asignar al reconocedor. Debe tener 63 caracteres como máximo.

model
(deprecated)

string

Opcional. Este campo ya no está disponible. Prefiere el campo model del mensaje RecognitionConfig.

Qué modelo se debe usar para las solicitudes de reconocimiento. Selecciona el modelo que mejor se adapte a tu dominio para obtener los mejores resultados.

Puedes consultar las directrices para elegir el modelo que vas a usar en la documentación de los modelos de transcripción y los modelos admitidos en cada región en la tabla de modelos admitidos.

language_codes[]
(deprecated)

string

Opcional. Este campo ya no está disponible. Prefiere el campo language_codes del mensaje RecognitionConfig.

El idioma del audio proporcionado como etiqueta de idioma BCP-47.

Los idiomas admitidos para cada modelo se indican en la tabla de modelos admitidos.

Si se proporcionan idiomas adicionales, el resultado del reconocimiento contendrá el reconocimiento en el idioma detectado más probable. El resultado del reconocimiento incluirá la etiqueta de idioma del idioma detectado en el audio. Cuando creas o actualizas un Recognizer, estos valores se almacenan en formato BCP-47 normalizado. Por ejemplo, "en-us" se almacena como "en-US".

default_recognition_config

RecognitionConfig

Configuración predeterminada que se usará en las solicitudes con este Recognizer. Se puede sobrescribir mediante la configuración insertada en el campo RecognizeRequest.config.

annotations

map<string, string>

Permite a los usuarios almacenar pequeñas cantidades de datos arbitrarios. Tanto la clave como el valor deben tener 63 caracteres como máximo. Un máximo de 100 anotaciones.

state

State

Solo de salida. El estado del ciclo de vida de Recognizer.

create_time

Timestamp

Solo de salida. Hora de creación.

update_time

Timestamp

Solo de salida. La hora más reciente en la que se modificó este Recognizer.

delete_time

Timestamp

Solo de salida. La hora a la que se solicitó la eliminación de este Recognizer.

expire_time

Timestamp

Solo de salida. La hora a la que se purgará este Recognizer.

etag

string

Solo de salida. El servidor calcula esta suma de comprobación en función del valor de otros campos. Puede enviarse en solicitudes de actualización, restauración y eliminación para asegurarse de que el cliente tenga un valor actualizado antes de continuar.

reconciling

bool

Solo de salida. Indica si este Recognizer está en proceso de actualización.

kms_key_name

string

Solo de salida. El nombre de la clave de KMS con la que se cifra el reconocedor. El formato esperado es projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

kms_key_version_name

string

Solo de salida. El nombre de la versión de la clave de KMS con la que se cifra el reconocedor. El formato esperado es projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}/cryptoKeyVersions/{crypto_key_version}.

Estado

Conjunto de estados que definen el ciclo de vida de un Recognizer.

Enumeraciones
STATE_UNSPECIFIED El valor predeterminado. Este valor se usa si se omite el estado.
ACTIVE El reconocedor está activo y listo para usarse.
DELETED Se ha eliminado este reconocedor.

SpeakerDiarizationConfig

Configuración para habilitar la diarización del interlocutor.

Campos
min_speaker_count

int32

Opcional. El sistema determina automáticamente el número de altavoces. Este valor no se usa actualmente.

max_speaker_count

int32

Opcional. El sistema determina automáticamente el número de altavoces. Este valor no se usa actualmente.

SpeechAdaptation

Proporciona "sugerencias" al reconocedor de voz para favorecer palabras y frases específicas en los resultados. Los PhraseSets se pueden especificar como un recurso insertado o como una referencia a un recurso PhraseSet.

Campos
phrase_sets[]

AdaptationPhraseSet

Lista de PhraseSets insertados o a los que se hace referencia.

custom_classes[]

CustomClass

Lista de CustomClasses insertadas. Se puede hacer referencia directamente a los recursos CustomClass en un PhraseSet.

AdaptationPhraseSet

Un PhraseSet de sesgo, que puede ser una cadena que haga referencia al nombre de un recurso PhraseSets o una definición insertada de un PhraseSet.

Campos

Campo de unión value.

value solo puede ser una de estas dos opciones:

phrase_set

string

Nombre de un recurso PhraseSet. El usuario debe tener acceso de lectura al recurso y este no debe haberse eliminado.

inline_phrase_set

PhraseSet

Un PhraseSet definido insertado.

SpeechRecognitionAlternative

Hipótesis alternativas (también conocidas como lista de mejor N).

Campos
transcript

string

Texto de transcripción que representa las palabras que el usuario habló.

confidence

float

La estimación de confianza se encuentra entre 0,0 y 1,0. Un número más alto indica una mayor probabilidad estimada de que las palabras reconocidas sean correctas. Este campo solo se define para la alternativa principal de un resultado que no es de streaming o de un resultado de streaming en el que is_final tiene el valor true. No se garantiza que este campo sea preciso y los usuarios no deben confiar en que siempre se proporcione. El valor predeterminado 0.0 es un valor de centinela que indica que confidence no se ha definido.

words[]

WordInfo

Una lista de información específica de la palabra para cada palabra reconocida. Cuando se haya definido el SpeakerDiarizationConfig, verás todas las palabras desde el principio del audio.

SpeechRecognitionResult

Un resultado de reconocimiento de voz correspondiente a una parte del audio.

Campos
alternatives[]

SpeechRecognitionAlternative

Puede contener una o varias hipótesis de reconocimiento. Estas alternativas están ordenadas en términos de precisión, siendo la alternativa principal (la primera) la más probable, según la clasificación del reconocedor.

channel_tag

int32

Para audio multicanal, este es el número de canal correspondiente al resultado reconocido para el audio de ese canal. Si audio_channel_count = N, los valores de salida pueden oscilar entre 1 y N.

result_end_offset

Duration

Desfase de tiempo del final de este resultado con respecto al inicio del audio.

language_code

string

Solo de salida. La etiqueta de idioma BCP-47 del idioma de este resultado. Se ha detectado que este código de idioma es el que tiene más probabilidades de ser el que se habla en el audio.

SrtOutputFileFormatConfig

Este tipo no tiene campos.

Configuraciones de salida de archivos de subtítulos con formato SubRip Text.

StreamingRecognitionConfig

Proporciona información de configuración para la solicitud StreamingRecognize.

Campos
config

RecognitionConfig

Obligatorio. Funciones y metadatos de audio que se van a usar para el reconocimiento automático del habla. Este campo, junto con el campo config_mask, se puede usar para anular partes del default_recognition_config del recurso Recognizer.

config_mask

FieldMask

Lista de campos de config que anulan los valores de default_recognition_config del reconocedor durante esta solicitud de reconocimiento. Si no se proporciona ninguna máscara, todos los campos con valores no predeterminados de config anularán los valores del reconocedor de esta solicitud de reconocimiento. Si se proporciona una máscara, solo los campos que se incluyan en ella anularán la configuración del Recognizer en esta solicitud de reconocimiento. Si se proporciona un comodín (*), config anula y sustituye por completo la configuración del reconocedor en esta solicitud de reconocimiento.

streaming_features

StreamingRecognitionFeatures

Funciones de reconocimiento de voz para habilitar solicitudes específicas de reconocimiento de audio en streaming.

StreamingRecognitionFeatures

Funciones de reconocimiento disponibles específicas de las solicitudes de reconocimiento de streaming.

Campos
enable_voice_activity_events

bool

Si true, las respuestas con eventos de voz de actividad de voz se devolverán a medida que se detecten.

interim_results

bool

Indica si se deben enviar resultados provisionales al cliente. Si se le asigna el valor true, los resultados provisionales se enviarán al cliente. De lo contrario, solo se devolverá la respuesta final.

voice_activity_timeout

VoiceActivityTimeout

Si se define, el servidor cerrará automáticamente el flujo una vez transcurrido el tiempo especificado después de que se haya enviado el último evento de voz VOICE_ACTIVITY. El campo voice_activity_events también debe tener el valor true.

VoiceActivityTimeout

Eventos en los que se puede definir un tiempo de espera para la actividad de voz.

Campos
speech_start_timeout

Duration

Duración del tiempo de espera de la emisión si no se empieza a hablar. Si se define este valor y no se detecta voz durante este periodo al inicio del flujo, el servidor cerrará el flujo.

speech_end_timeout

Duration

Duración del tiempo de espera de la emisión después de que termine la voz. Si se define este valor y no se detecta habla durante este periodo después de haber detectado habla, el servidor cerrará el flujo.

StreamingRecognitionResult

Resultado de reconocimiento de voz en streaming correspondiente a una parte del audio que se está procesando.

Campos
alternatives[]

SpeechRecognitionAlternative

Puede contener una o varias hipótesis de reconocimiento. Estas alternativas están ordenadas en términos de precisión, siendo la alternativa principal (la primera) la más probable, según la clasificación del reconocedor.

is_final

bool

Si false, este StreamingRecognitionResult representa un resultado provisional que puede cambiar. Si true, esta es la última vez que el servicio de voz devolverá este StreamingRecognitionResult concreto. El reconocedor no devolverá más hipótesis para esta parte de la transcripción y el audio correspondiente.

stability

float

Una estimación de la probabilidad de que el reconocedor no cambie su suposición sobre este resultado provisional. Los valores van de 0,0 (completamente inestable) a 1,0 (completamente estable). Este campo solo se proporciona para los resultados provisionales (is_final=false). El valor predeterminado 0.0 es un valor de centinela que indica que stability no se ha definido.

result_end_offset

Duration

Desfase de tiempo del final de este resultado con respecto al inicio del audio.

channel_tag

int32

Para audio multicanal, este es el número de canal correspondiente al resultado reconocido para el audio de ese canal. En el caso de audio_channel_count = N, los valores de salida pueden oscilar entre 1 y N.

language_code

string

Solo de salida. La etiqueta de idioma BCP-47 del idioma de este resultado. Se ha detectado que este código de idioma es el que tiene más probabilidades de ser el que se habla en el audio.

StreamingRecognizeRequest

Mensaje de solicitud del método StreamingRecognize. Se envían varios mensajes de StreamingRecognizeRequest en una llamada.

Si el Recognizer al que hace referencia recognizer contiene una configuración de solicitud totalmente especificada, el flujo solo puede contener mensajes con audio definido.

De lo contrario, el primer mensaje debe contener un mensaje recognizer y un mensaje streaming_config que, en conjunto, especifiquen completamente la configuración de la solicitud y no contengan audio. Todos los mensajes posteriores solo deben tener el valor audio.

Campos
recognizer

string

Obligatorio. Nombre del Recognizer que se va a usar durante el reconocimiento. El formato esperado es projects/{project}/locations/{location}/recognizers/{recognizer}. El segmento {recognizer} se puede definir como _ para usar un Recognizer implícito vacío.

Campo de unión streaming_request.

streaming_request solo puede ser una de estas dos opciones:

streaming_config

StreamingRecognitionConfig

StreamingRecognitionConfig que se va a usar en este intento de reconocimiento. Si se proporciona, se usará en lugar del RecognitionConfig predeterminado almacenado en el Recognizer.

audio

bytes

Bytes de audio insertados que se van a reconocer. El tamaño máximo de este campo es de 15 kB por solicitud.

StreamingRecognizeResponse

StreamingRecognizeResponse es el único mensaje que devuelve StreamingRecognize al cliente. Se envía al cliente una serie de cero o más mensajes StreamingRecognizeResponse. Si no hay audio reconocible, no se enviarán mensajes al cliente.

Estos son algunos ejemplos de StreamingRecognizeResponse que se pueden devolver al procesar audio:

  1. results { alternatives { transcript: "tube" } stability: 0.01 }

  2. results { alternatives { transcript: "to be a" } stability: 0.01 }

  3. results { alternatives { transcript: "to be" } stability: 0.9 } results { alternatives { transcript: " or not to be" } stability: 0.01 }

  4. results { alternatives { transcript: "to be or not to be" confidence: 0.92 } alternatives { transcript: "to bee or not to bee" } is_final: true }

  5. results { alternatives { transcript: " that's" } stability: 0.01 }

  6. results { alternatives { transcript: " that is" } stability: 0.9 } results { alternatives { transcript: " the question" } stability: 0.01 }

  7. results { alternatives { transcript: " that is the question" confidence: 0.98 } alternatives { transcript: " that was the question" } is_final: true }

Notas:

  • Solo dos de las respuestas anteriores (la 4 y la 7) contienen resultados finales, que se indican con is_final: true. Al concatenarlos, se genera la transcripción completa: "ser o no ser, esa es la cuestión".

  • Los demás contienen results provisionales. Los elementos #3 y #6 contienen dos results provisionales: la primera parte tiene una alta estabilidad y es menos probable que cambie; la segunda parte tiene una baja estabilidad y es muy probable que cambie. Un diseñador de interfaces de usuario puede optar por mostrar solo results de alta estabilidad.

  • Los valores específicos de stability y confidence que se muestran arriba son solo ejemplos. Los valores reales pueden variar.

  • En cada respuesta, solo se definirá uno de estos campos: error, speech_event_type o uno o varios campos results (repetidos).

Campos
results[]

StreamingRecognitionResult

Esta lista repetida contiene cero o más resultados que corresponden a partes consecutivas del audio que se está procesando. Contiene cero o un resultado is_final=true (la parte recién liquidada), seguido de cero o más resultados is_final=false (los resultados provisionales).

speech_event_type

SpeechEventType

Indica el tipo de evento de voz.

speech_event_offset

Duration

Desfase de tiempo entre el inicio del audio y la emisión del evento.

metadata

RecognitionResponseMetadata

Metadatos sobre el reconocimiento.

SpeechEventType

Indica el tipo de evento de voz.

Enumeraciones
SPEECH_EVENT_TYPE_UNSPECIFIED No se ha especificado ningún evento de voz.
END_OF_SINGLE_UTTERANCE Este evento indica que el servidor ha detectado el final de la expresión oral del usuario y no espera que diga nada más. Por lo tanto, el servidor no procesará más audio y cerrará el flujo bidireccional de gRPC. Este evento solo se envía si se ha producido un corte forzado porque se ha detectado silencio antes de tiempo. Este evento solo está disponible a través de latest_short model.
SPEECH_ACTIVITY_BEGIN Este evento indica que el servidor ha detectado el inicio de la actividad de voz humana en el flujo. Este evento se puede devolver varias veces si la voz empieza y se detiene repetidamente a lo largo de la emisión. Este evento solo se envía si se le asigna el valor "true" a voice_activity_events.
SPEECH_ACTIVITY_END Este evento indica que el servidor ha detectado el final de la actividad de voz humana en el flujo. Este evento se puede devolver varias veces si la voz empieza y se detiene repetidamente a lo largo de la emisión. Este evento solo se envía si se le asigna el valor "true" a voice_activity_events.

TranscriptNormalization

Configuración de normalización de transcripciones. Usa la normalización de la transcripción para sustituir automáticamente partes de la transcripción por las frases que elijas. En el caso de StreamingRecognize, esta normalización solo se aplica a las transcripciones parciales estables (estabilidad > 0,8) y a las transcripciones finales.

Campos
entries[]

Entry

Una lista de entradas de sustitución. Realizaremos la sustitución de una entrada cada vez. Por ejemplo, la segunda entrada de ["cat" => "dog", "mountain cat" => "mountain dog"] nunca se aplicará porque siempre procesaremos la primera entrada antes. 100 entradas como máximo.

Entrada

Una sola configuración de sustitución.

Campos
search

string

Qué se va a sustituir. La longitud máxima es de 100 caracteres.

replace

string

Qué se va a sustituir. La longitud máxima es de 100 caracteres.

case_sensitive

bool

Indica si la búsqueda distingue entre mayúsculas y minúsculas.

TranslationConfig

Configuración de traducción. Se usa para traducir el audio proporcionado a texto en el idioma deseado.

Campos
target_language

string

Obligatorio. El código de idioma al que se va a traducir.

UndeleteCustomClassRequest

Mensaje de solicitud del método UndeleteCustomClass.

Campos
name

string

Obligatorio. Nombre de la CustomClass que se va a restaurar. Formato: projects/{project}/locations/{location}/customClasses/{custom_class}

validate_only

bool

Si se define, valida la solicitud y muestra una vista previa de la CustomClass restaurada, pero no la restaura.

etag

string

El servidor calcula esta suma de comprobación en función del valor de otros campos. Puede enviarse en solicitudes de actualización, restauración y eliminación para asegurarse de que el cliente tenga un valor actualizado antes de continuar.

UndeletePhraseSetRequest

Mensaje de solicitud del método UndeletePhraseSet.

Campos
name

string

Obligatorio. Nombre del objeto PhraseSet que se va a restaurar. Formato: projects/{project}/locations/{location}/phraseSets/{phrase_set}

validate_only

bool

Si se define, valida la solicitud y muestra una vista previa de PhraseSet restaurado, pero no lo restaura.

etag

string

El servidor calcula esta suma de comprobación en función del valor de otros campos. Puede enviarse en solicitudes de actualización, restauración y eliminación para asegurarse de que el cliente tenga un valor actualizado antes de continuar.

UndeleteRecognizerRequest

Mensaje de solicitud del método UndeleteRecognizer.

Campos
name

string

Obligatorio. Nombre del Recognizer que se va a restaurar. Formato: projects/{project}/locations/{location}/recognizers/{recognizer}

validate_only

bool

Si se define, valida la solicitud y previsualiza el Recognizer restaurado, pero no lo restaura.

etag

string

El servidor calcula esta suma de comprobación en función del valor de otros campos. Puede enviarse en solicitudes de actualización, restauración y eliminación para asegurarse de que el cliente tenga un valor actualizado antes de continuar.

UpdateConfigRequest

Mensaje de solicitud del método UpdateConfig.

Campos
config

Config

Obligatorio. La configuración que se va a actualizar.

El campo name de la configuración se usa para identificar la configuración que se va a actualizar. El formato esperado es projects/{project}/locations/{location}/config.

update_mask

FieldMask

Lista de campos que se van a actualizar.

UpdateCustomClassRequest

Mensaje de solicitud del método UpdateCustomClass.

Campos
custom_class

CustomClass

Obligatorio. El objeto CustomClass que se va a actualizar.

El campo name de CustomClass se usa para identificar el CustomClass que se va a actualizar. Formato: projects/{project}/locations/{location}/customClasses/{custom_class}.

update_mask

FieldMask

Lista de campos que se van a actualizar. Si está vacío, se tendrán en cuenta todos los campos para la actualización.

validate_only

bool

Si se define, valida la solicitud y muestra una vista previa de la CustomClass actualizada, pero no la actualiza.

UpdatePhraseSetRequest

Mensaje de solicitud del método UpdatePhraseSet.

Campos
phrase_set

PhraseSet

Obligatorio. El objeto PhraseSet que se va a actualizar.

El campo name de PhraseSet se usa para identificar el PhraseSet que se va a actualizar. Formato: projects/{project}/locations/{location}/phraseSets/{phrase_set}.

update_mask

FieldMask

Lista de campos que se van a actualizar. Si está vacío, se tendrán en cuenta todos los campos con valores no predeterminados para la actualización. Usa * para actualizar todo el recurso PhraseSet.

validate_only

bool

Si se define, valida la solicitud y muestra una vista previa del PhraseSet actualizado, pero no lo actualiza.

UpdateRecognizerRequest

Mensaje de solicitud del método UpdateRecognizer.

Campos
recognizer

Recognizer

Obligatorio. El Recognizer que se va a actualizar.

El campo name de Recognizer se usa para identificar el Recognizer que se va a actualizar. Formato: projects/{project}/locations/{location}/recognizers/{recognizer}.

update_mask

FieldMask

Lista de campos que se van a actualizar. Si está vacío, se tendrán en cuenta todos los campos con valores no predeterminados para la actualización. Usa * para actualizar todo el recurso Recognizer.

validate_only

bool

Si se define, valida la solicitud y muestra una vista previa del Recognizer actualizado, pero no lo actualiza.

VttOutputFileFormatConfig

Este tipo no tiene campos.

Configuraciones de salida para archivos de subtítulos en formato WebVTT.

WordInfo

Información específica de la palabra para palabras reconocidas.

Campos
start_offset

Duration

Compensación horaria referente al comienzo del audio y correspondiente al inicio de la palabra hablada. Este campo solo se define si enable_word_time_offsets es true y solo en la hipótesis principal. Esta es una característica experimental y la precisión de la compensación horaria puede variar.

end_offset

Duration

Compensación horaria referente al comienzo del audio y correspondiente al final de la palabra hablada. Este campo solo se define si enable_word_time_offsets es true y solo en la hipótesis principal. Esta es una característica experimental y la precisión de la compensación horaria puede variar.

word

string

La palabra correspondiente a este conjunto de información.

confidence

float

La estimación de confianza se encuentra entre 0,0 y 1,0. Un número más alto indica una mayor probabilidad estimada de que las palabras reconocidas sean correctas. Este campo solo se define para la alternativa principal de un resultado que no es de streaming o de un resultado de streaming en el que is_final tiene el valor true. No se garantiza que este campo sea preciso y los usuarios no deben confiar en que siempre se proporcione. El valor predeterminado 0.0 es un valor de centinela que indica que confidence no se ha definido.

speaker_label

string

Se asigna una etiqueta diferente a cada interlocutor del audio. Este campo especifica cuál de esos interlocutores se ha detectado que ha pronunciado esta palabra. speaker_label se asigna si se proporciona SpeakerDiarizationConfig y solo en la alternativa principal.