Package google.cloud.speech.v2

Index

Voix

Permet la transcription vocale et la gestion des ressources.

BatchRecognize

rpc BatchRecognize(BatchRecognizeRequest) returns (Operation)

Effectue une reconnaissance vocale asynchrone par lot : envoie une requête avec N fichiers audio et reçoit une opération de longue durée qui peut être interrogée pour savoir quand les transcriptions sont terminées.

Niveaux d'accès des autorisations

Requiert le niveau d'accès OAuth suivant :

  • https://www.googleapis.com/auth/cloud-platform

Pour plus d'informations, consultez la Authentication Overview.

Autorisations IAM

Nécessite l'autorisation IAM suivante sur la ressource recognizer :

  • speech.recognizers.recognize

Pour en savoir plus, consultez la documentation IAM.

CreateCustomClass

rpc CreateCustomClass(CreateCustomClassRequest) returns (Operation)

Crée un objet CustomClass.

Niveaux d'accès des autorisations

Requiert le niveau d'accès OAuth suivant :

  • https://www.googleapis.com/auth/cloud-platform

Pour plus d'informations, consultez la Authentication Overview.

Autorisations IAM

Nécessite l'autorisation IAM suivante sur la ressource parent :

  • speech.customClasses.create

Pour en savoir plus, consultez la documentation IAM.

CreatePhraseSet

rpc CreatePhraseSet(CreatePhraseSetRequest) returns (Operation)

Crée un objet PhraseSet.

Niveaux d'accès des autorisations

Requiert le niveau d'accès OAuth suivant :

  • https://www.googleapis.com/auth/cloud-platform

Pour plus d'informations, consultez la Authentication Overview.

Autorisations IAM

Nécessite l'autorisation IAM suivante sur la ressource parent :

  • speech.phraseSets.create

Pour en savoir plus, consultez la documentation IAM.

CreateRecognizer

rpc CreateRecognizer(CreateRecognizerRequest) returns (Operation)

Crée un objet Recognizer.

Niveaux d'accès des autorisations

Requiert le niveau d'accès OAuth suivant :

  • https://www.googleapis.com/auth/cloud-platform

Pour plus d'informations, consultez la Authentication Overview.

Autorisations IAM

Nécessite l'autorisation IAM suivante sur la ressource parent :

  • speech.recognizers.create

Pour en savoir plus, consultez la documentation IAM.

DeleteCustomClass

rpc DeleteCustomClass(DeleteCustomClassRequest) returns (Operation)

Supprime le CustomClass.

Niveaux d'accès des autorisations

Requiert le niveau d'accès OAuth suivant :

  • https://www.googleapis.com/auth/cloud-platform

Pour plus d'informations, consultez la Authentication Overview.

Autorisations IAM

Nécessite l'autorisation IAM suivante sur la ressource name :

  • speech.customClasses.delete

Pour en savoir plus, consultez la documentation IAM.

DeletePhraseSet

rpc DeletePhraseSet(DeletePhraseSetRequest) returns (Operation)

Supprime le PhraseSet.

Niveaux d'accès des autorisations

Requiert le niveau d'accès OAuth suivant :

  • https://www.googleapis.com/auth/cloud-platform

Pour plus d'informations, consultez la Authentication Overview.

Autorisations IAM

Nécessite l'autorisation IAM suivante sur la ressource name :

  • speech.phraseSets.delete

Pour en savoir plus, consultez la documentation IAM.

DeleteRecognizer

rpc DeleteRecognizer(DeleteRecognizerRequest) returns (Operation)

Supprime le Recognizer.

Niveaux d'accès des autorisations

Requiert le niveau d'accès OAuth suivant :

  • https://www.googleapis.com/auth/cloud-platform

Pour plus d'informations, consultez la Authentication Overview.

Autorisations IAM

Nécessite l'autorisation IAM suivante sur la ressource name :

  • speech.recognizers.delete

Pour en savoir plus, consultez la documentation IAM.

GetConfig

rpc GetConfig(GetConfigRequest) returns (Config)

Renvoie le Config demandé.

Niveaux d'accès des autorisations

Requiert le niveau d'accès OAuth suivant :

  • https://www.googleapis.com/auth/cloud-platform

Pour plus d'informations, consultez la Authentication Overview.

Autorisations IAM

Nécessite l'autorisation IAM suivante sur la ressource name :

  • speech.config.get

Pour en savoir plus, consultez la documentation IAM.

GetCustomClass

rpc GetCustomClass(GetCustomClassRequest) returns (CustomClass)

Renvoie le CustomClass demandé.

Niveaux d'accès des autorisations

Requiert le niveau d'accès OAuth suivant :

  • https://www.googleapis.com/auth/cloud-platform

Pour plus d'informations, consultez la Authentication Overview.

Autorisations IAM

Nécessite l'autorisation IAM suivante sur la ressource name :

  • speech.customClasses.get

Pour en savoir plus, consultez la documentation IAM.

GetPhraseSet

rpc GetPhraseSet(GetPhraseSetRequest) returns (PhraseSet)

Renvoie le PhraseSet demandé.

Niveaux d'accès des autorisations

Requiert le niveau d'accès OAuth suivant :

  • https://www.googleapis.com/auth/cloud-platform

Pour plus d'informations, consultez la Authentication Overview.

Autorisations IAM

Nécessite l'autorisation IAM suivante sur la ressource name :

  • speech.phraseSets.get

Pour en savoir plus, consultez la documentation IAM.

GetRecognizer

rpc GetRecognizer(GetRecognizerRequest) returns (Recognizer)

Renvoie le Recognizer demandé. Échoue avec NOT_FOUND si l'outil de reconnaissance demandé n'existe pas.

Niveaux d'accès des autorisations

Requiert le niveau d'accès OAuth suivant :

  • https://www.googleapis.com/auth/cloud-platform

Pour plus d'informations, consultez la Authentication Overview.

Autorisations IAM

Nécessite l'autorisation IAM suivante sur la ressource name :

  • speech.recognizers.get

Pour en savoir plus, consultez la documentation IAM.

ListCustomClasses

rpc ListCustomClasses(ListCustomClassesRequest) returns (ListCustomClassesResponse)

Répertorie les objets CustomClasses.

Niveaux d'accès des autorisations

Requiert le niveau d'accès OAuth suivant :

  • https://www.googleapis.com/auth/cloud-platform

Pour plus d'informations, consultez la Authentication Overview.

Autorisations IAM

Nécessite l'autorisation IAM suivante sur la ressource parent :

  • speech.customClasses.list

Pour en savoir plus, consultez la documentation IAM.

ListPhraseSets

rpc ListPhraseSets(ListPhraseSetsRequest) returns (ListPhraseSetsResponse)

Liste les ensembles de phrases.

Niveaux d'accès des autorisations

Requiert le niveau d'accès OAuth suivant :

  • https://www.googleapis.com/auth/cloud-platform

Pour plus d'informations, consultez la Authentication Overview.

Autorisations IAM

Nécessite l'autorisation IAM suivante sur la ressource parent :

  • speech.phraseSets.list

Pour en savoir plus, consultez la documentation IAM.

ListRecognizers

rpc ListRecognizers(ListRecognizersRequest) returns (ListRecognizersResponse)

Répertorie les outils de reconnaissance.

Niveaux d'accès des autorisations

Requiert le niveau d'accès OAuth suivant :

  • https://www.googleapis.com/auth/cloud-platform

Pour plus d'informations, consultez la Authentication Overview.

Autorisations IAM

Nécessite l'autorisation IAM suivante sur la ressource parent :

  • speech.recognizers.list

Pour en savoir plus, consultez la documentation IAM.

Reconnaissance

rpc Recognize(RecognizeRequest) returns (RecognizeResponse)

Effectue une reconnaissance vocale synchrone : recevez les résultats après que toutes les données audio ont été envoyées et traitées.

Niveaux d'accès des autorisations

Requiert le niveau d'accès OAuth suivant :

  • https://www.googleapis.com/auth/cloud-platform

Pour plus d'informations, consultez la Authentication Overview.

Autorisations IAM

Nécessite l'autorisation IAM suivante sur la ressource recognizer :

  • speech.recognizers.recognize

Pour en savoir plus, consultez la documentation IAM.

StreamingRecognize

rpc StreamingRecognize(StreamingRecognizeRequest) returns (StreamingRecognizeResponse)

Effectue une reconnaissance vocale en continu bidirectionnelle : recevez les résultats tout en envoyant les données audio. Cette méthode n'est disponible que via l'API gRPC (non REST).

Niveaux d'accès des autorisations

Requiert le niveau d'accès OAuth suivant :

  • https://www.googleapis.com/auth/cloud-platform

Pour plus d'informations, consultez la Authentication Overview.

Autorisations IAM

Nécessite l'autorisation IAM suivante sur la ressource recognizer :

  • speech.recognizers.recognize

Pour en savoir plus, consultez la documentation IAM.

UndeleteCustomClass

rpc UndeleteCustomClass(UndeleteCustomClassRequest) returns (Operation)

Restaure le CustomClass.

Niveaux d'accès des autorisations

Requiert le niveau d'accès OAuth suivant :

  • https://www.googleapis.com/auth/cloud-platform

Pour plus d'informations, consultez la Authentication Overview.

Autorisations IAM

Nécessite l'autorisation IAM suivante sur la ressource name :

  • speech.customClasses.undelete

Pour en savoir plus, consultez la documentation IAM.

UndeletePhraseSet

rpc UndeletePhraseSet(UndeletePhraseSetRequest) returns (Operation)

Restaure le PhraseSet.

Niveaux d'accès des autorisations

Requiert le niveau d'accès OAuth suivant :

  • https://www.googleapis.com/auth/cloud-platform

Pour plus d'informations, consultez la Authentication Overview.

Autorisations IAM

Nécessite l'autorisation IAM suivante sur la ressource name :

  • speech.phraseSets.undelete

Pour en savoir plus, consultez la documentation IAM.

UndeleteRecognizer

rpc UndeleteRecognizer(UndeleteRecognizerRequest) returns (Operation)

Restaure le Recognizer.

Niveaux d'accès des autorisations

Requiert le niveau d'accès OAuth suivant :

  • https://www.googleapis.com/auth/cloud-platform

Pour plus d'informations, consultez la Authentication Overview.

Autorisations IAM

Nécessite l'autorisation IAM suivante sur la ressource name :

  • speech.recognizers.undelete

Pour en savoir plus, consultez la documentation IAM.

UpdateConfig

rpc UpdateConfig(UpdateConfigRequest) returns (Config)

Met à jour l'objet Config.

Niveaux d'accès des autorisations

Requiert le niveau d'accès OAuth suivant :

  • https://www.googleapis.com/auth/cloud-platform

Pour plus d'informations, consultez la Authentication Overview.

Autorisations IAM

Nécessite l'autorisation IAM suivante sur la ressource name :

  • speech.config.update

Pour en savoir plus, consultez la documentation IAM.

UpdateCustomClass

rpc UpdateCustomClass(UpdateCustomClassRequest) returns (Operation)

Met à jour l'objet CustomClass.

Niveaux d'accès des autorisations

Requiert le niveau d'accès OAuth suivant :

  • https://www.googleapis.com/auth/cloud-platform

Pour plus d'informations, consultez la Authentication Overview.

Autorisations IAM

Nécessite l'autorisation IAM suivante sur la ressource name :

  • speech.customClasses.update

Pour en savoir plus, consultez la documentation IAM.

UpdatePhraseSet

rpc UpdatePhraseSet(UpdatePhraseSetRequest) returns (Operation)

Met à jour l'objet PhraseSet.

Niveaux d'accès des autorisations

Requiert le niveau d'accès OAuth suivant :

  • https://www.googleapis.com/auth/cloud-platform

Pour plus d'informations, consultez la Authentication Overview.

Autorisations IAM

Nécessite l'autorisation IAM suivante sur la ressource name :

  • speech.phraseSets.update

Pour en savoir plus, consultez la documentation IAM.

UpdateRecognizer

rpc UpdateRecognizer(UpdateRecognizerRequest) returns (Operation)

Met à jour l'objet Recognizer.

Niveaux d'accès des autorisations

Requiert le niveau d'accès OAuth suivant :

  • https://www.googleapis.com/auth/cloud-platform

Pour plus d'informations, consultez la Authentication Overview.

Autorisations IAM

Nécessite l'autorisation IAM suivante sur la ressource name :

  • speech.recognizers.update

Pour en savoir plus, consultez la documentation IAM.

AccessMetadata

Métadonnées d'accès pour une région spécifique. Cela peut être appliqué si la règle d'administration pour le projet donné n'autorise pas une région spécifique.

Champs
constraint_type

ConstraintType

Décrit les différents types de contraintes appliquées.

ConstraintType

Décrit les différents types de contraintes pouvant être appliquées à une région.

Enums
CONSTRAINT_TYPE_UNSPECIFIED Une contrainte non spécifiée a été appliquée.
RESOURCE_LOCATIONS_ORG_POLICY_CREATE_CONSTRAINT Les règles de l'organisation du projet n'autorisent pas la région indiquée.

AutoDetectDecodingConfig

Ce type ne comporte aucun champ.

Paramètres de décodage détectés automatiquement. Compatible avec les encodages suivants :

  • WAV_LINEAR16 : échantillons PCM little-endian de 16 bits signés dans un conteneur WAV.

  • WAV_MULAW : échantillons mulaw compressés de 8 bits dans un conteneur WAV.

  • WAV_ALAW : échantillons alaw compressés de 8 bits dans un conteneur WAV.

  • RFC4867_5_AMR : trames AMR avec un en-tête rfc4867.5.

  • RFC4867_5_AMRWB : trames AMR-WB avec un en-tête rfc4867.5.

  • FLAC : trames FLAC au format de conteneur "FLAC natif".

  • MP3 : frames audio MPEG avec métadonnées ID3 facultatives (ignorées).

  • OGG_OPUS : trames audio Opus dans un conteneur Ogg.

  • WEBM_OPUS : trames audio Opus dans un conteneur WebM.

  • MP4_AAC : trames audio AAC dans un conteneur MP4.

  • M4A_AAC : trames audio AAC dans un conteneur M4A.

  • MOV_AAC : trames audio AAC dans un conteneur MOV.

BatchRecognizeFileMetadata

Métadonnées concernant un seul fichier dans un lot pour BatchRecognize.

Champs
config

RecognitionConfig

Fonctionnalités et métadonnées audio à utiliser pour la reconnaissance vocale automatique. Ce champ, associé au champ config_mask, peut être utilisé pour remplacer des parties de default_recognition_config de la ressource Recognizer, ainsi que config au niveau de la requête.

config_mask

FieldMask

Liste des champs de config qui remplacent les valeurs de default_recognition_config de l'outil de reconnaissance lors de cette requête de reconnaissance. Si aucun masque n'est fourni, tous les champs dont les valeurs ne sont pas celles par défaut dans config remplacent les valeurs de l'outil de reconnaissance pour cette requête de reconnaissance. Si un masque est fourni, seuls les champs affichés correspondent à la configuration de l'outil de reconnaissance pour cette requête de reconnaissance. Si un caractère générique (*) est fourni, config remplace complètement la configuration dans l'outil de reconnaissance pour cette requête de reconnaissance.

Champ d'union audio_source. Correspond à la source audio, qui se présente sous la forme d'un URI Google Cloud Storage. audio_source ne peut être qu'un des éléments suivants :
uri

string

URI Cloud Storage du fichier audio.

BatchRecognizeFileResult

Résultats finaux pour un seul fichier.

Champs
error

Status

Erreur, le cas échéant.

metadata

RecognitionResponseMetadata

uri
(deprecated)

string

Obsolète. Utilisez plutôt cloud_storage_result.native_format_uri.

transcript
(deprecated)

BatchRecognizeResults

Obsolète. Utilisez plutôt inline_result.transcript.

Champ d'union result.

result ne peut être qu'un des éléments suivants :

cloud_storage_result

CloudStorageResult

Résultats de reconnaissance écrits dans Cloud Storage. Ce champ n'est renseigné que lorsque GcsOutputConfig est défini dans la configuration [RecognitionOutputConfig][google.cloud.speech.v2.RecognitionOutputConfig.

inline_result

InlineResult

Résultats de la reconnaissance. Ce champ n'est renseigné que lorsque InlineOutputConfig est défini dans [RecognitionOutputConfig][google.cloud.speech.v2.RecognitionOutputConfig.

BatchRecognizeMetadata

Métadonnées de l'opération pour BatchRecognize.

Champs
transcription_metadata

map<string, BatchRecognizeTranscriptionMetadata>

Mapper le nom de fichier fourni aux métadonnées de transcription de ce fichier.

BatchRecognizeRequest

Message de requête pour la méthode BatchRecognize.

Champs
recognizer

string

Obligatoire. Nom de l'outil de reconnaissance à utiliser lors de la reconnaissance. Le format attendu est projects/{project}/locations/{location}/recognizers/{recognizer}. Le segment {recognizer} peut être défini sur _ pour utiliser un outil de reconnaissance implicite vide.

config

RecognitionConfig

Fonctionnalités et métadonnées audio à utiliser pour la reconnaissance vocale automatique. Ce champ, associé au champ config_mask, peut être utilisé pour remplacer des parties du default_recognition_config de la ressource Recognizer.

config_mask

FieldMask

Liste des champs de config qui remplacent les valeurs de default_recognition_config de l'outil de reconnaissance lors de cette requête de reconnaissance. Si aucun masque n'est fourni, tous les champs indiqués dans config remplacent les valeurs de l'outil de reconnaissance pour cette requête de reconnaissance. Si un masque est fourni, seuls les champs affichés correspondent à la configuration de l'outil de reconnaissance pour cette requête de reconnaissance. Si un caractère générique (*) est fourni, config remplace complètement la configuration dans l'outil de reconnaissance pour cette requête de reconnaissance.

files[]

BatchRecognizeFileMetadata

Fichiers audio avec métadonnées pour la reconnaissance vocale. Vous pouvez spécifier un maximum de 15 fichiers.

recognition_output_config

RecognitionOutputConfig

Options de configuration permettant de spécifier où afficher les transcriptions de chaque fichier.

processing_strategy

ProcessingStrategy

Stratégie de traitement à utiliser pour cette requête.

ProcessingStrategy

Stratégies de traitement possibles pour les requêtes par lot.

Enums
PROCESSING_STRATEGY_UNSPECIFIED Valeur par défaut de la stratégie de traitement. La demande est traitée dès sa réception.
DYNAMIC_BATCHING Si cette option est sélectionnée, la requête est traitée pendant les périodes de faible utilisation pour bénéficier d'une remise. La demande est traitée dans les 24 heures.

BatchRecognizeResponse

Message de réponse pour BatchRecognize, qui est inclus dans un Operation de longue durée.

Champs
results

map<string, BatchRecognizeFileResult>

Mapper le nom de fichier au résultat final de ce fichier.

total_billed_duration

Duration

Le cas échéant, secondes audio facturées pour la requête correspondante.

BatchRecognizeResults

Type de sortie pour Cloud Storage des transcriptions BatchRecognize. Bien que ce fichier proto ne soit renvoyé nulle part dans cette API, les transcriptions Cloud Storage seront sérialisées dans ce fichier et doivent être analysées comme tel.

Champs
results[]

SpeechRecognitionResult

Liste séquentielle des résultats de transcription correspondant à des parties séquentielles de l'audio.

metadata

RecognitionResponseMetadata

Métadonnées sur la reconnaissance.

BatchRecognizeTranscriptionMetadata

Métadonnées sur la transcription d'un seul fichier (par exemple, le pourcentage de progression).

Champs
progress_percent

int32

Quantité de fichiers transcrits jusqu'à présent.

error

Status

Erreur, le cas échéant.

uri

string

URI Cloud Storage dans lequel les résultats de la reconnaissance seront écrits.

CloudStorageResult

Résultats finaux écrits dans Cloud Storage.

Champs
uri

string

URI Cloud Storage dans lequel les résultats de la reconnaissance ont été écrits.

vtt_format_uri

string

URI Cloud Storage dans lequel les résultats de la reconnaissance ont été écrits sous forme de sous-titres au format VTT. Ce champ n'est renseigné que lorsque la sortie VTT est demandée.

srt_format_uri

string

URI Cloud Storage dans lequel les résultats de la reconnaissance ont été écrits sous forme de sous-titres au format SRT. Ce champ n'est renseigné que lorsque la sortie SRT est demandée.

Config

Message représentant la configuration de l'API Speech-to-Text. Cela inclut une clé KMS facultative avec laquelle les données entrantes seront chiffrées.

Champs
name

string

Uniquement en sortie. Identifiant. Nom de la ressource de configuration. Il existe exactement une ressource de configuration par projet et par emplacement. Le format attendu est projects/{project}/locations/{location}/config.

kms_key_name

string

Facultatif. Nom de clé KMS facultatif qui, le cas échéant, sera utilisé pour chiffrer les ressources Speech-to-Text au repos. La mise à jour de cette clé n'aura pas pour effet de chiffrer les ressources existantes à l'aide de cette clé. Seules les nouvelles ressources seront chiffrées à l'aide de cette clé. Le format attendu est projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

update_time

Timestamp

Uniquement en sortie. Heure de la dernière modification de cette ressource.

CreateCustomClassRequest

Message de requête pour la méthode CreateCustomClass.

Champs
custom_class

CustomClass

Obligatoire. CustomClass à créer.

validate_only

bool

Si ce champ est défini, validez la requête et prévisualisez la CustomClass, mais ne la créez pas réellement.

custom_class_id

string

ID à utiliser pour la CustomClass, qui constituera le composant final du nom de ressource de la CustomClass.

Cette valeur doit contenir entre 1 et 63 caractères, et les caractères valides sont /[az][0-9]-/.

parent

string

Obligatoire. Projet et emplacement dans lesquels cette CustomClass sera créée. Le format attendu est projects/{project}/locations/{location}.

CreatePhraseSetRequest

Message de requête pour la méthode CreatePhraseSet.

Champs
phrase_set

PhraseSet

Obligatoire. Ensemble de phrases à créer.

validate_only

bool

Si ce champ est défini, validez la requête et prévisualisez l'ensemble de phrases, mais ne le créez pas réellement.

phrase_set_id

string

ID à utiliser pour l'ensemble de phrases, qui constituera le composant final du nom de ressource de l'ensemble de phrases.

Cette valeur doit contenir entre 1 et 63 caractères, et les caractères valides sont /[az][0-9]-/.

parent

string

Obligatoire. Projet et emplacement dans lesquels cet ensemble de phrases sera créé. Le format attendu est projects/{project}/locations/{location}.

CreateRecognizerRequest

Message de requête pour la méthode CreateRecognizer.

Champs
recognizer

Recognizer

Obligatoire. Programme de reconnaissance à créer.

validate_only

bool

Si ce champ est défini, validez la requête et prévisualisez l'outil de reconnaissance, mais ne le créez pas réellement.

recognizer_id

string

ID à utiliser pour l'outil de reconnaissance, qui constituera le composant final du nom de ressource de l'outil de reconnaissance.

Cette valeur doit contenir entre 1 et 63 caractères, et les caractères valides sont /[az][0-9]-/.

parent

string

Obligatoire. Projet et emplacement dans lesquels cet outil de reconnaissance sera créé. Le format attendu est projects/{project}/locations/{location}.

CustomClass

CustomClass pour la pondération de la reconnaissance vocale. Permet de définir un ensemble de mots ou d'expressions représentant un concept ou un thème commun susceptible d'apparaître dans votre contenu audio, par exemple une liste de noms de navires à passagers.

Champs
name

string

Uniquement en sortie. Identifiant. Nom de ressource de la CustomClass. Format : projects/{project}/locations/{location}/customClasses/{custom_class}.

uid

string

Uniquement en sortie. Identifiant unique attribué par le système pour CustomClass.

display_name

string

Facultatif. Nom lisible et défini par l'utilisateur pour l'objet CustomClass. L'ID ne doit pas contenir plus de 63 caractères

items[]

ClassItem

Collection d'éléments de cours.

state

State

Uniquement en sortie. État du cycle de vie de l'objet CustomClass.

create_time

Timestamp

Uniquement en sortie. Heure de création.

update_time

Timestamp

Uniquement en sortie. Heure de la dernière modification de cette ressource.

delete_time

Timestamp

Uniquement en sortie. Heure à laquelle la suppression de cette ressource a été demandée.

expire_time

Timestamp

Uniquement en sortie. Heure à laquelle cette ressource sera supprimée.

annotations

map<string, string>

Facultatif. Permet aux utilisateurs de stocker de petites quantités de données arbitraires. La clé et la valeur ne doivent pas comporter plus de 63 caractères chacune. 100 annotations au maximum.

etag

string

Uniquement en sortie. Cette somme de contrôle est calculée par le serveur en fonction de la valeur des autres champs. Peut être envoyé lors des requêtes de mise à jour, de restauration et de suppression pour s'assurer que le client dispose d'une valeur à jour avant de continuer.

reconciling

bool

Uniquement en sortie. Indique si cet objet CustomClass est en cours de mise à jour.

kms_key_name

string

Uniquement en sortie. Nom de la clé KMS avec laquelle l'objet CustomClass est chiffré. Le format attendu est projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

kms_key_version_name

string

Uniquement en sortie. Nom de la version de clé KMS avec laquelle l'objet CustomClass est chiffré. Le format attendu est projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}/cryptoKeyVersions/{crypto_key_version}.

ClassItem

Élément de la classe.

Champs
value

string

Valeur de l'élément de classe.

État

Ensemble d'états qui définissent le cycle de vie d'un objet CustomClass.

Enums
STATE_UNSPECIFIED État non spécifié. Cette valeur n'est utilisée/utile que pour distinguer les valeurs non définies.
ACTIVE État normal et actif.
DELETED Cet objet CustomClass a été supprimé.

DeleteCustomClassRequest

Message de requête pour la méthode DeleteCustomClass.

Champs
name

string

Obligatoire. Nom de la CustomClass à supprimer. Format : projects/{project}/locations/{location}/customClasses/{custom_class}

validate_only

bool

Si ce champ est défini, validez la requête et prévisualisez la CustomClass supprimée, mais ne la supprimez pas réellement.

allow_missing

bool

Si la valeur est définie sur "true" et que la CustomClass est introuvable, la requête aboutit et est une opération "no-op" (aucune opération n'est enregistrée dans ce cas).

etag

string

Cette somme de contrôle est calculée par le serveur en fonction de la valeur des autres champs. Peut être envoyé lors des requêtes de mise à jour, de restauration et de suppression pour s'assurer que le client dispose d'une valeur à jour avant de continuer.

DeletePhraseSetRequest

Message de requête pour la méthode DeletePhraseSet.

Champs
name

string

Obligatoire. Nom de l'ensemble de phrases à supprimer. Format : projects/{project}/locations/{location}/phraseSets/{phrase_set}

validate_only

bool

Si ce champ est défini, validez la requête et prévisualisez l'ensemble de phrases supprimé, mais ne le supprimez pas réellement.

allow_missing

bool

Si la valeur est définie sur "true" et que l'ensemble de phrases est introuvable, la requête aboutit et est une no-op (aucune opération n'est enregistrée dans ce cas).

etag

string

Cette somme de contrôle est calculée par le serveur en fonction de la valeur des autres champs. Peut être envoyé lors des requêtes de mise à jour, de restauration et de suppression pour s'assurer que le client dispose d'une valeur à jour avant de continuer.

DeleteRecognizerRequest

Message de requête pour la méthode DeleteRecognizer.

Champs
name

string

Obligatoire. Nom de l'outil de reconnaissance à supprimer. Format : projects/{project}/locations/{location}/recognizers/{recognizer}

validate_only

bool

Si ce champ est défini, validez la requête et prévisualisez l'outil de reconnaissance supprimé, mais ne le supprimez pas réellement.

allow_missing

bool

Si la valeur est définie sur "true" et que l'outil de reconnaissance est introuvable, la requête aboutit et est une opération "no-op" (aucune opération n'est enregistrée dans ce cas).

etag

string

Cette somme de contrôle est calculée par le serveur en fonction de la valeur des autres champs. Peut être envoyé lors des requêtes de mise à jour, de restauration et de suppression pour s'assurer que le client dispose d'une valeur à jour avant de continuer.

DenoiserConfig

Configuration de la suppression du bruit. Cette fonctionnalité n'est peut-être pas disponible pour tous les modèles et peut n'avoir aucun effet.

Champs
denoise_audio

bool

Supprimez le bruit de l'audio avant de l'envoyer au modèle de transcription.

snr_threshold

float

Seuil de rapport signal/bruit (SNR) pour le débruiteur. Ici, le SNR désigne le volume du signal vocal. L'audio dont le SNR est inférieur à ce seuil (c'est-à-dire dont la parole est trop faible) ne pourra pas être envoyé au modèle de transcription.

Si snr_threshold=0, aucun filtrage ne sera appliqué.

ExplicitDecodingConfig

Paramètres de décodage spécifiés explicitement.

Champs
encoding

AudioEncoding

Obligatoire. Encodage des données audio envoyées pour la reconnaissance.

sample_rate_hertz

int32

Facultatif. Taux d'échantillonnage en hertz des données audio envoyées pour la reconnaissance. Les valeurs valides sont comprises entre 8 000 et 48 000. La valeur optimale est 16 000. Pour de meilleurs résultats, définissez le taux d'échantillonnage de la source audio sur 16 000 Hz. Si ce n'est pas possible, utilisez le taux d'échantillonnage natif de la source audio (plutôt que d'effectuer un ré-échantillonnage). Notez que ce champ est marqué comme FACULTATIF pour des raisons de rétrocompatibilité. Elle est (et a toujours été) effectivement OBLIGATOIRE.

audio_channel_count

int32

Facultatif. Nombre de canaux présents dans les données audio envoyées pour la reconnaissance. Notez que ce champ est marqué comme FACULTATIF pour des raisons de rétrocompatibilité. Elle est (et a toujours été) effectivement OBLIGATOIRE.

La valeur maximale autorisée est de 8.

AudioEncoding

Encodages de données audio compatibles.

Enums
AUDIO_ENCODING_UNSPECIFIED Valeur par défaut. Cette valeur n'est pas utilisée.
LINEAR16 Échantillons PCM little-endian de 16 bits signés sans en-tête.
MULAW Échantillons MULAW compressés de 8 bits sans en-tête.
ALAW Échantillons alaw compressés de 8 bits sans en-tête.
AMR Frames AMR avec un en-tête rfc4867.5.
AMR_WB Frames AMR-WB avec un en-tête rfc4867.5.
FLAC Frames FLAC au format de conteneur "FLAC natif".
MP3 Frames audio MPEG avec métadonnées ID3 facultatives (ignorées).
OGG_OPUS Trames audio Opus dans un conteneur Ogg.
WEBM_OPUS Trames audio Opus dans un conteneur WebM.
MP4_AAC Trames audio AAC dans un conteneur MP4.
M4A_AAC Trames audio AAC dans un conteneur M4A.
MOV_AAC Trames audio AAC dans un conteneur MOV.

GcsOutputConfig

Configurations de sortie pour Cloud Storage.

Champs
uri

string

Préfixe d'URI Cloud Storage avec lequel les résultats de la reconnaissance seront écrits.

GetConfigRequest

Message de requête pour la méthode GetConfig.

Champs
name

string

Obligatoire. Nom de la configuration à récupérer. Il existe exactement une ressource de configuration par projet et par emplacement. Le format attendu est projects/{project}/locations/{location}/config.

GetCustomClassRequest

Message de requête pour la méthode GetCustomClass.

Champs
name

string

Obligatoire. Nom de la CustomClass à récupérer. Le format attendu est projects/{project}/locations/{location}/customClasses/{custom_class}.

GetPhraseSetRequest

Message de requête pour la méthode GetPhraseSet.

Champs
name

string

Obligatoire. Nom de l'ensemble de phrases à récupérer. Le format attendu est projects/{project}/locations/{location}/phraseSets/{phrase_set}.

GetRecognizerRequest

Message de requête pour la méthode GetRecognizer.

Champs
name

string

Obligatoire. Nom de l'outil de reconnaissance à récupérer. Le format attendu est projects/{project}/locations/{location}/recognizers/{recognizer}.

InlineOutputConfig

Ce type ne comporte aucun champ.

Configurations de sortie pour la réponse intégrée.

InlineResult

Les résultats finaux sont renvoyés en ligne dans la réponse de reconnaissance.

Champs
transcript

BatchRecognizeResults

Transcription du fichier audio.

vtt_captions

string

Transcription du fichier audio sous forme de sous-titres au format VTT. Ce champ n'est renseigné que lorsque la sortie VTT est demandée.

srt_captions

string

Transcription du fichier audio sous forme de sous-titres au format SRT. Ce champ n'est renseigné que lorsque la sortie SRT est demandée.

LanguageMetadata

Métadonnées sur les paramètres régionaux disponibles dans une région donnée. Actuellement, il s'agit uniquement des modèles disponibles pour chaque paramètre régional.

Champs
models

map<string, ModelMetadata>

Mappage des paramètres régionaux (code de langue) aux modèles

ListCustomClassesRequest

Message de requête pour la méthode ListCustomClasses.

Champs
parent

string

Obligatoire. Projet et emplacement des ressources CustomClass à lister. Le format attendu est projects/{project}/locations/{location}.

page_size

int32

Nombre de résultats par requête. Une valeur page_size valide est comprise entre 0 et 100 (inclus). Si la valeur de page_size est nulle ou non spécifiée, une taille de page de 5 sera choisie. Si la taille de la page dépasse 100, elle sera réduite à 100. Notez qu'un appel peut renvoyer moins de résultats que la taille de page demandée.

page_token

string

Jeton de page reçu d'un appel ListCustomClasses précédent. Fournissez-le pour récupérer la page suivante.

Lors de la pagination, tous les autres paramètres fournis à ListCustomClasses doivent correspondre à l'appel ayant fourni le jeton de page.

show_deleted

bool

Indique si les ressources supprimées doivent être affichées ou non.

ListCustomClassesResponse

Message de réponse pour la méthode ListCustomClasses.

Champs
custom_classes[]

CustomClass

Liste des CustomClasses demandées.

next_page_token

string

Jeton pouvant être envoyé en tant que page_token pour récupérer la page suivante. Si ce champ est omis, il n'y a pas d'autres pages. Ce jeton expire au bout de 72 heures.

ListPhraseSetsRequest

Message de requête pour la méthode ListPhraseSets.

Champs
parent

string

Obligatoire. Projet et emplacement des ressources PhraseSet à lister. Le format attendu est projects/{project}/locations/{location}.

page_size

int32

Nombre maximal de PhraseSets à renvoyer. Le service peut renvoyer un nombre inférieur à cette valeur. Si aucune valeur n'est spécifiée, cinq ensembles d'expressions au maximum sont renvoyés. La valeur maximale est 100. Les valeurs supérieures sont réduites à 100.

page_token

string

Jeton de page reçu d'un appel ListPhraseSets précédent. Fournissez-le pour récupérer la page suivante.

Lors de la pagination, tous les autres paramètres fournis à ListPhraseSets doivent correspondre à l'appel ayant fourni le jeton de page.

show_deleted

bool

Indique si les ressources supprimées doivent être affichées ou non.

ListPhraseSetsResponse

Message de réponse pour la méthode ListPhraseSets.

Champs
phrase_sets[]

PhraseSet

Liste des PhraseSets demandés.

next_page_token

string

Jeton pouvant être envoyé en tant que page_token pour récupérer la page suivante. Si ce champ est omis, il n'y a pas d'autres pages. Ce jeton expire au bout de 72 heures.

ListRecognizersRequest

Message de requête pour la méthode ListRecognizers.

Champs
parent

string

Obligatoire. Projet et emplacement des outils de reconnaissance à lister. Le format attendu est projects/{project}/locations/{location}.

page_size

int32

Nombre maximal de Recognizers à renvoyer. Le service peut renvoyer un nombre inférieur à cette valeur. Si aucune valeur n'est spécifiée, cinq éléments Recognizer au maximum sont renvoyés. La valeur maximale est 100. Les valeurs supérieures sont réduites à 100.

page_token

string

Jeton de page reçu d'un appel ListRecognizers précédent. Fournissez-le pour récupérer la page suivante.

Lors de la pagination, tous les autres paramètres fournis à ListRecognizers doivent correspondre à l'appel ayant fourni le jeton de page.

show_deleted

bool

Indique si les ressources supprimées doivent être affichées ou non.

ListRecognizersResponse

Message de réponse pour la méthode ListRecognizers.

Champs
recognizers[]

Recognizer

Liste des outils de reconnaissance demandés.

next_page_token

string

Jeton pouvant être envoyé en tant que page_token pour récupérer la page suivante. Si ce champ est omis, il n'y a pas d'autres pages. Ce jeton expire au bout de 72 heures.

LocationsMetadata

Métadonnées principales de l'API Locations pour STT V2. Actuellement, il s'agit uniquement des métadonnées sur les paramètres régionaux, les modèles et les fonctionnalités.

Champs
languages

LanguageMetadata

Informations sur les paramètres régionaux, les modèles et les fonctionnalités disponibles, représentées dans la structure hiérarchique des paramètres régionaux > modèles > fonctionnalités

access_metadata

AccessMetadata

Informations sur les métadonnées d'accès pour la région et le projet concernés.

ModelFeature

Représente une caractéristique unique d'un modèle. Si la fonctionnalité est recognizer, l'état de publication de la fonctionnalité représente l'état de publication du modèle.

Champs
feature

string

Nom de la fonctionnalité (remarque : la fonctionnalité peut être recognizer)

release_state

string

État de la fonctionnalité

ModelFeatures

Représente la collection de caractéristiques appartenant à un modèle.

Champs
model_feature[]

ModelFeature

Champ répété contenant toutes les caractéristiques du modèle

ModelMetadata

Métadonnées sur les modèles dans une région donnée pour un paramètre régional spécifique. Actuellement, il s'agit uniquement des caractéristiques du modèle.

Champs
model_features

map<string, ModelFeatures>

Mappage du nom du modèle aux caractéristiques de ce modèle

NativeOutputFileFormatConfig

Ce type ne comporte aucun champ.

Configurations de sortie pour les protos BatchRecognizeResults sérialisés.

OperationMetadata

Représente les métadonnées d'une opération de longue durée.

Champs
create_time

Timestamp

Heure à laquelle l'opération a été créée.

update_time

Timestamp

Date et heure de la dernière mise à jour de l'opération.

resource

string

Chemin d'accès à la ressource pour la cible de l'opération.

method

string

Méthode ayant déclenché l'opération.

kms_key_name

string

Nom de la clé KMS avec laquelle le contenu de l'opération est chiffré. Le format attendu est projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

kms_key_version_name

string

Nom de la version de clé KMS avec laquelle le contenu de l'opération est chiffré. Le format attendu est projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}/cryptoKeyVersions/{crypto_key_version}.

progress_percent

int32

Pourcentage de progression de l'opération. Les valeurs peuvent être comprises entre 0 et 100. Si la valeur est de 100, l'opération est terminée.

Champ d'union request. Requête qui a généré l'opération. request ne peut être qu'un des éléments suivants :
batch_recognize_request

BatchRecognizeRequest

BatchRecognizeRequest qui a généré l'opération.

create_recognizer_request

CreateRecognizerRequest

CreateRecognizerRequest qui a généré l'opération.

update_recognizer_request

UpdateRecognizerRequest

UpdateRecognizerRequest qui a généré l'opération.

delete_recognizer_request

DeleteRecognizerRequest

DeleteRecognizerRequest qui a généré l'opération.

undelete_recognizer_request

UndeleteRecognizerRequest

UndeleteRecognizerRequest qui a généré l'opération.

create_custom_class_request

CreateCustomClassRequest

CreateCustomClassRequest qui a généré l'opération.

update_custom_class_request

UpdateCustomClassRequest

UpdateCustomClassRequest qui a généré l'opération.

delete_custom_class_request

DeleteCustomClassRequest

DeleteCustomClassRequest qui a généré l'opération.

undelete_custom_class_request

UndeleteCustomClassRequest

UndeleteCustomClassRequest qui a généré l'opération.

create_phrase_set_request

CreatePhraseSetRequest

CreatePhraseSetRequest qui a généré l'opération.

update_phrase_set_request

UpdatePhraseSetRequest

UpdatePhraseSetRequest qui a généré l'opération.

delete_phrase_set_request

DeletePhraseSetRequest

DeletePhraseSetRequest qui a généré l'opération.

undelete_phrase_set_request

UndeletePhraseSetRequest

UndeletePhraseSetRequest qui a généré l'opération.

update_config_request
(deprecated)

UpdateConfigRequest

UpdateConfigRequest qui a généré l'opération.

Champ d'union metadata. Métadonnées spécifiques à chaque RPC. metadata ne peut être qu'un des éléments suivants :
batch_recognize_metadata

BatchRecognizeMetadata

Métadonnées spécifiques à la méthode BatchRecognize.

OutputFormatConfig

Configuration du format des résultats stockés dans output.

Champs
native

NativeOutputFileFormatConfig

Configuration du format de sortie natif. Si ce champ est défini ou si aucun autre champ de format de sortie n'est défini, les transcriptions seront écrites dans le récepteur au format natif.

vtt

VttOutputFileFormatConfig

Configuration du format de sortie VTT. Si ce champ est défini, les transcriptions sont écrites dans le récepteur au format VTT.

srt

SrtOutputFileFormatConfig

Configuration du format de sortie SRT. Si ce champ est défini, les transcriptions sont écrites dans le récepteur au format SRT.

PhraseSet

PhraseSet pour la pondération de la reconnaissance vocale. Un PhraseSet est utilisé pour fournir des "indices" à l'outil de reconnaissance vocale afin de privilégier certains mots et expressions dans les résultats.

Champs
name

string

Uniquement en sortie. Identifiant. Nom de ressource du PhraseSet. Format : projects/{project}/locations/{location}/phraseSets/{phrase_set}.

uid

string

Uniquement en sortie. Identifiant unique attribué par le système pour le PhraseSet.

phrases[]

Phrase

Une liste de mots et d'expressions.

boost

float

Boost d'indices Une valeur positive augmentera la probabilité qu'une expression spécifique soit reconnue par rapport à d'autres expressions similaires. Plus le boost est élevé, plus le risque de faux positif est élevé. Les valeurs boost valides sont comprises entre 0 (exclus) et 20. Nous vous recommandons d'utiliser une approche de recherche binaire pour trouver la valeur optimale pour votre cas d'utilisation, ainsi que d'ajouter des expressions avec et sans boost à vos requêtes.

display_name

string

Nom lisible et défini par l'utilisateur pour l'objet PhraseSet. L'ID ne doit pas contenir plus de 63 caractères

state

State

Uniquement en sortie. État du cycle de vie de PhraseSet.

create_time

Timestamp

Uniquement en sortie. Heure de création.

update_time

Timestamp

Uniquement en sortie. Heure de la dernière modification de cette ressource.

delete_time

Timestamp

Uniquement en sortie. Heure à laquelle la suppression de cette ressource a été demandée.

expire_time

Timestamp

Uniquement en sortie. Heure à laquelle cette ressource sera supprimée.

annotations

map<string, string>

Permet aux utilisateurs de stocker de petites quantités de données arbitraires. La clé et la valeur ne doivent pas comporter plus de 63 caractères chacune. 100 annotations au maximum.

etag

string

Uniquement en sortie. Cette somme de contrôle est calculée par le serveur en fonction de la valeur des autres champs. Peut être envoyé lors des requêtes de mise à jour, de restauration et de suppression pour s'assurer que le client dispose d'une valeur à jour avant de continuer.

reconciling

bool

Uniquement en sortie. Indique si cet objet PhraseSet est en cours de mise à jour.

kms_key_name

string

Uniquement en sortie. Nom de la clé KMS avec laquelle PhraseSet est chiffré. Le format attendu est projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

kms_key_version_name

string

Uniquement en sortie. Nom de la version de clé KMS avec laquelle le PhraseSet est chiffré. Le format attendu est projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}/cryptoKeyVersions/{crypto_key_version}.

Expression

Une expression contient des mots et des expressions qui fournissent des indications afin que la reconnaissance vocale soit plus susceptible de les reconnaître. Cette liste permet d'améliorer la précision de certains termes et phrases, notamment dans des commandes spécifiques généralement prononcées par l'utilisateur. Elle offre également la possibilité d'ajouter des mots supplémentaires au vocabulaire de l'outil de reconnaissance.

Les éléments de liste peuvent également inclure des références CustomClass contenant des groupes de mots qui représentent des concepts courants dans le langage naturel.

Champs
value

string

L'expression elle-même.

boost

float

Boost d'indices Remplace l'amélioration définie au niveau de l'ensemble d'expressions. Une valeur positive augmentera la probabilité qu'une expression spécifique soit reconnue par rapport à d'autres expressions similaires. Plus le boost est élevé, plus le risque de faux positif est élevé. Les valeurs de boost négatives correspondent à l'anti-biais. L'anti-biais n'est pas activé. Les valeurs de boost négatives renverront donc une erreur. Les valeurs d'amélioration doivent être comprises entre 0 et 20. Toute valeur en dehors de cette plage renverra une erreur. Nous vous recommandons d'utiliser une approche de recherche binaire pour trouver la valeur optimale pour votre cas d'utilisation, ainsi que d'ajouter des expressions avec et sans boost à vos requêtes.

État

Ensemble d'états qui définissent le cycle de vie d'un objet PhraseSet.

Enums
STATE_UNSPECIFIED État non spécifié. Cette valeur n'est utilisée/utile que pour distinguer les valeurs non définies.
ACTIVE État normal et actif.
DELETED Cet ensemble de phrases a été supprimé.

RecognitionConfig

Fournit à l'outil de reconnaissance des informations qui spécifient comment traiter la requête de reconnaissance.

Champs
model

string

Facultatif. Modèle à utiliser pour les requêtes de reconnaissance. Sélectionnez le modèle le mieux adapté à votre domaine pour obtenir de meilleurs résultats.

Pour savoir quel modèle utiliser, consultez la documentation sur les modèles de transcription. Pour connaître les modèles compatibles dans chaque région, consultez le tableau des modèles compatibles.

language_codes[]

string

Facultatif. Langue de l'audio fourni en tant que tag de langue BCP-47. Les balises de langue sont normalisées au format BCP-47 avant d'être utilisées (par exemple, "en-us" devient "en-US").

Les langues acceptées pour chaque modèle sont listées dans le tableau des modèles acceptés.

Si des langues supplémentaires sont fournies, le résultat de la reconnaissance contiendra la reconnaissance dans la langue la plus probable détectée. Le résultat de la reconnaissance inclura le tag de la langue détectée dans l'audio.

features

RecognitionFeatures

Fonctionnalités de reconnaissance vocale à activer.

adaptation

SpeechAdaptation

Contexte d'adaptation vocale qui pondère les prédictions du système de reconnaissance pour des mots et expressions spécifiques.

transcript_normalization

TranscriptNormalization

Facultatif. Utilisez la normalisation de la transcription pour remplacer automatiquement des parties de la transcription par les expressions de votre choix. Pour StreamingRecognize, cette normalisation ne s'applique qu'aux transcriptions partielles stables (stabilité > 0,8) et aux transcriptions finales.

translation_config

TranslationConfig

Facultatif. Configuration facultative utilisée pour exécuter automatiquement la traduction de l'audio donné dans la langue souhaitée pour les modèles compatibles.

denoiser_config

DenoiserConfig

Facultatif. Configuration facultative de la suppression du bruit. Cette fonctionnalité n'est peut-être pas disponible pour tous les modèles et peut n'avoir aucun effet.

Champ d'union decoding_config. Paramètres de décodage de l'audio envoyé pour reconnaissance. decoding_config ne peut être qu'un des éléments suivants :
auto_decoding_config

AutoDetectDecodingConfig

Détectez automatiquement les paramètres de décodage. Préféré pour les formats compatibles.

explicit_decoding_config

ExplicitDecodingConfig

Paramètres de décodage spécifiés explicitement. Obligatoire si vous utilisez l'audio PCM sans en-tête (linear16, mulaw, alaw).

RecognitionFeatures

Fonctionnalités de reconnaissance disponibles.

Champs
profanity_filter

bool

Si le champ est défini sur true, le serveur tente de filtrer le langage grossier en remplaçant tous les caractères (sauf le premier) de chaque mot filtré par des astérisques. Par exemple : "p*****". Si la valeur est false ou si le champ est omis, les grossièretés ne sont pas filtrées.

enable_word_time_offsets

bool

Si la valeur est true, le premier résultat inclut une liste de mots et les décalages temporels de début et de fin (horodatages) associés. Si la valeur est false, aucun horodatage au niveau du mot n'est renvoyé. La valeur par défaut est false.

enable_word_confidence

bool

Si la valeur est true, le premier résultat inclut une liste de mots ainsi que leur fiabilité. Si la valeur est false, aucune information de fiabilité au niveau du mot n'est renvoyée. La valeur par défaut est false.

enable_automatic_punctuation

bool

Si la valeur est définie sur true, ajoute un signe de ponctuation aux hypothèses de résultat de la reconnaissance. Cette fonctionnalité n'est disponible que pour certaines langues. La valeur false par défaut n'ajoute pas de signe de ponctuation aux hypothèses de résultat.

enable_spoken_punctuation

bool

Comportement vis-à-vis de la ponctuation énoncée pour l'appel. Si la valeur est true, remplace la ponctuation énoncée par les symboles correspondants dans la requête. Par exemple, "comment allez-vous point d'interrogation" devient "Comment allez-vous ?" Pour obtenir de l'aide, consultez https://cloud.google.com/speech-to-text/docs/spoken-punctuation. Si la valeur est false, la ponctuation énoncée n'est pas remplacée.

enable_spoken_emojis

bool

Comportement vis-à-vis des emoji énoncés pour l'appel. Si la valeur est true, ajoute la mise en forme des emoji énoncés pour la requête. Les emoji énoncés seront remplacés par les symboles Unicode correspondants dans la transcription finale. Si la valeur est false, les emoji énoncés ne sont pas remplacés.

multi_channel_mode

MultiChannelMode

Mode de reconnaissance de l'audio multicanal.

diarization_config

SpeakerDiarizationConfig

Configuration pour activer l'identification des locuteurs. Pour activer l'identification des locuteurs, définissez ce champ sur un message SpeakerDiarizationConfig vide.

max_alternatives

int32

Nombre maximal d'hypothèses de reconnaissance à renvoyer. Le serveur peut renvoyer un nombre inférieur à max_alternatives. Les valeurs valides sont comprises entre 0 et 30. Une valeur de 0 ou 1 renverra un maximum d'un résultat. Si celle-ci est omise, un maximum de 1 est également renvoyé.

MultiChannelMode

Options permettant de reconnaître l'audio multicanal.

Enums
MULTI_CHANNEL_MODE_UNSPECIFIED Valeur par défaut pour le mode multicanal. Si l'audio contient plusieurs canaux, seul le premier sera transcrit. Les autres seront ignorés.
SEPARATE_RECOGNITION_PER_CHANNEL Si cette option est sélectionnée, chaque canal de l'audio fourni est transcrit indépendamment. Cette option ne peut pas être sélectionnée si la valeur de model est latest_short.

RecognitionOutputConfig

Options de configuration pour les sorties de reconnaissance.

Champs
output_format_config

OutputFormatConfig

Facultatif. Configuration du format des résultats stockés dans output. Si aucune valeur n'est spécifiée, les transcriptions seront écrites uniquement au format NATIVE.

Champ d'union output.

output ne peut être qu'un des éléments suivants :

gcs_output_config

GcsOutputConfig

Si ce message s'affiche, les résultats de la reconnaissance sont écrits dans l'URI Google Cloud Storage fourni.

inline_response_config

InlineOutputConfig

Si ce message est renseigné, les résultats de la reconnaissance sont fournis dans le message BatchRecognizeResponse de l'opération une fois celle-ci terminée. Cette option n'est disponible que lorsque vous appelez BatchRecognize avec un seul fichier audio.

RecognitionResponseMetadata

Métadonnées concernant la requête et la réponse de reconnaissance.

Champs
request_id

string

Identifiant de requête global généré automatiquement par l'API.

total_billed_duration

Duration

Le cas échéant, secondes audio facturées pour la requête correspondante.

RecognizeRequest

Message de requête pour la méthode Recognize. Vous devez fournir la valeur content ou uri. Si vous n'en spécifiez aucune ou si vous spécifiez les deux, vous obtenez l'erreur INVALID_ARGUMENT. Consultez la section Limites relatives au contenu.

Champs
recognizer

string

Obligatoire. Nom de l'outil de reconnaissance à utiliser lors de la reconnaissance. Le format attendu est projects/{project}/locations/{location}/recognizers/{recognizer}. Le segment {recognizer} peut être défini sur _ pour utiliser un outil de reconnaissance implicite vide.

config

RecognitionConfig

Fonctionnalités et métadonnées audio à utiliser pour la reconnaissance vocale automatique. Ce champ, associé au champ config_mask, peut être utilisé pour remplacer des parties du default_recognition_config de la ressource Recognizer.

config_mask

FieldMask

Liste des champs de config qui remplacent les valeurs de default_recognition_config de l'outil de reconnaissance lors de cette requête de reconnaissance. Si aucun masque n'est fourni, tous les champs dont les valeurs ne sont pas celles par défaut dans config remplacent les valeurs de l'outil de reconnaissance pour cette requête de reconnaissance. Si un masque est fourni, seuls les champs affichés correspondent à la configuration de l'outil de reconnaissance pour cette requête de reconnaissance. Si un caractère générique (*) est fourni, config remplace complètement la configuration dans l'outil de reconnaissance pour cette requête de reconnaissance.

Champ d'union audio_source. Correspond à la source audio, qui se présente sous la forme de contenu intégré ou d'un URI Google Cloud Storage. audio_source ne peut être qu'un des éléments suivants :
content

bytes

Les octets de données audio sont encodés comme spécifié dans RecognitionConfig. Comme pour tous les champs d'octets, les tampons de protocole utilisent une représentation binaire pure, tandis que les représentations JSON sont encodées en base64.

uri

string

URI qui pointe vers un fichier contenant des octets de données audio, comme spécifié dans RecognitionConfig. Le fichier ne doit pas être compressé (par exemple, au format gzip). Actuellement, seuls les URI Google Cloud Storage sont acceptés. Ils doivent être spécifiés au format suivant : gs://bucket_name/object_name (les autres formats d'URI renvoient INVALID_ARGUMENT). Pour en savoir plus, consultez la section URI de la demande.

RecognizeResponse

Message de réponse pour la méthode Recognize.

Champs
results[]

SpeechRecognitionResult

Liste séquentielle des résultats de transcription correspondant à des parties séquentielles de l'audio.

metadata

RecognitionResponseMetadata

Métadonnées sur la reconnaissance.

Outil de reconnaissance

Message de l'outil de reconnaissance. Stocke la configuration et les métadonnées de reconnaissance.

Champs
name

string

Uniquement en sortie. Identifiant. Nom de ressource de l'outil de reconnaissance. Format : projects/{project}/locations/{location}/recognizers/{recognizer}.

uid

string

Uniquement en sortie. Identifiant unique attribué par le système au module de reconnaissance.

display_name

string

Nom lisible et défini par l'utilisateur pour l'outil de reconnaissance. L'ID ne doit pas contenir plus de 63 caractères

model
(deprecated)

string

Facultatif. Ce champ est désormais obsolète. Préférez le champ model dans le message RecognitionConfig.

Modèle à utiliser pour les requêtes de reconnaissance. Sélectionnez le modèle le mieux adapté à votre domaine pour obtenir de meilleurs résultats.

Pour savoir quel modèle utiliser, consultez la documentation sur les modèles de transcription. Pour connaître les modèles compatibles dans chaque région, consultez le tableau des modèles compatibles.

language_codes[]
(deprecated)

string

Facultatif. Ce champ est désormais obsolète. Préférez le champ language_codes dans le message RecognitionConfig.

Langue de l'audio fourni en tant que tag de langue BCP-47.

Les langues acceptées pour chaque modèle sont listées dans le tableau des modèles acceptés.

Si des langues supplémentaires sont fournies, le résultat de la reconnaissance contiendra la reconnaissance dans la langue la plus probable détectée. Le résultat de la reconnaissance inclura le tag de la langue détectée dans l'audio. Lorsque vous créez ou mettez à jour un Recognizer, ces valeurs sont stockées sous forme normalisée BCP-47. Par exemple, "en-us" est stocké sous la forme "en-US".

default_recognition_config

RecognitionConfig

Configuration par défaut à utiliser pour les requêtes avec cet outil de reconnaissance. Cette valeur peut être remplacée par une configuration intégrée dans le champ RecognizeRequest.config.

annotations

map<string, string>

Permet aux utilisateurs de stocker de petites quantités de données arbitraires. La clé et la valeur ne doivent pas comporter plus de 63 caractères chacune. 100 annotations au maximum.

state

State

Uniquement en sortie. État du cycle de vie de l'outil de reconnaissance.

create_time

Timestamp

Uniquement en sortie. Heure de création.

update_time

Timestamp

Uniquement en sortie. Date et heure de la dernière modification de ce module de reconnaissance.

delete_time

Timestamp

Uniquement en sortie. Heure à laquelle la suppression de ce Recognizer a été demandée.

expire_time

Timestamp

Uniquement en sortie. Heure à laquelle cet outil de reconnaissance sera supprimé.

etag

string

Uniquement en sortie. Cette somme de contrôle est calculée par le serveur en fonction de la valeur des autres champs. Peut être envoyé lors des requêtes de mise à jour, de restauration et de suppression pour s'assurer que le client dispose d'une valeur à jour avant de continuer.

reconciling

bool

Uniquement en sortie. Indique si cet outil de reconnaissance est en cours de mise à jour.

kms_key_name

string

Uniquement en sortie. Nom de la clé KMS avec laquelle le Recognizer est chiffré. Le format attendu est projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

kms_key_version_name

string

Uniquement en sortie. Nom de la version de clé KMS avec laquelle le Recognizer est chiffré. Le format attendu est projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}/cryptoKeyVersions/{crypto_key_version}.

État

Ensemble d'états qui définissent le cycle de vie d'un Recognizer.

Enums
STATE_UNSPECIFIED Valeur par défaut. Cette valeur est utilisée si l'état est omis.
ACTIVE Le module de reconnaissance est actif et prêt à être utilisé.
DELETED Ce module de reconnaissance a été supprimé.

SpeakerDiarizationConfig

Configuration pour activer l'identification des locuteurs.

Champs
min_speaker_count

int32

Facultatif. Le système détermine automatiquement le nombre de locuteurs. Cette valeur n'est pas utilisée pour le moment.

max_speaker_count

int32

Facultatif. Le système détermine automatiquement le nombre de locuteurs. Cette valeur n'est pas utilisée pour le moment.

SpeechAdaptation

Fournit des "indices" à l'outil de reconnaissance vocale pour privilégier certains mots et expressions dans les résultats. Les PhraseSets peuvent être spécifiés en tant que ressource intégrée ou en tant que référence à une ressource PhraseSet existante.

Champs
phrase_sets[]

AdaptationPhraseSet

Liste de PhraseSets intégrés ou référencés.

custom_classes[]

CustomClass

Liste des CustomClasses intégrées. Les ressources CustomClass existantes peuvent être référencées directement dans un PhraseSet.

AdaptationPhraseSet

Ensemble de phrases de biais, qui peut être une chaîne faisant référence au nom d'une ressource PhraseSets existante ou une définition intégrée d'un ensemble de phrases.

Champs

Champ d'union value.

value ne peut être qu'un des éléments suivants :

phrase_set

string

Nom d'une ressource PhraseSet existante. L'utilisateur doit disposer d'un accès en lecture à la ressource, qui ne doit pas avoir été supprimée.

inline_phrase_set

PhraseSet

Ensemble de phrases défini de manière intégrée.

SpeechRecognitionAlternative

Hypothèses alternatives (liste des n meilleures)

Champs
transcript

string

Texte de transcription représentant les mots prononcés par l'utilisateur.

confidence

float

Estimation de fiabilité comprise entre 0,0 et 1,0. Un nombre élevé indique une plus grande probabilité estimée que les mots reconnus soient corrects. Ce champ n'est défini que pour la première alternative d'un résultat n'étant pas sous forme de flux, ou d'un résultat de flux dans lequel is_final est défini sur true. La précision de ce champ n'est pas garantie. Les utilisateurs ne devraient pas s'attendre à ce qu'il soit toujours fourni. La valeur par défaut de 0,0 est une valeur sentinelle indiquant que la valeur confidence n'a pas été définie.

words[]

WordInfo

Liste d'informations spécifiques au mot pour chaque mot reconnu. Lorsque SpeakerDiarizationConfig est défini, tous les mots sont visibles depuis le début de l'audio.

SpeechRecognitionResult

Résultat de reconnaissance vocale correspondant à une partie des données audio.

Champs
alternatives[]

SpeechRecognitionAlternative

Peut contenir une ou plusieurs hypothèses de reconnaissance. Ces alternatives sont triées par précision, la première alternative étant la plus probable, par l'outil de reconnaissance.

channel_tag

int32

Avec des données audio multicanaux, il s'agit du numéro de canal correspondant au résultat reconnu pour les données audio provenant de ce canal. Si audio_channel_count = N, les valeurs de sortie peuvent aller de 1 à N.

result_end_offset

Duration

Décalage temporel de la fin de ce résultat par rapport au début de l'audio.

language_code

string

Uniquement en sortie. Le tag de langue BCP-47 dans ce résultat. Ce code de langue a été détecté comme ayant le plus de chances d'être parlé dans l'audio.

SrtOutputFileFormatConfig

Ce type ne comporte aucun champ.

Fichier de sous-titres au format SubRip Text.

StreamingRecognitionConfig

Fournit des informations de configuration pour la requête StreamingRecognize.

Champs
config

RecognitionConfig

Obligatoire. Fonctionnalités et métadonnées audio à utiliser pour la reconnaissance vocale automatique. Ce champ, associé au champ config_mask, peut être utilisé pour remplacer des parties du default_recognition_config de la ressource Recognizer.

config_mask

FieldMask

Liste des champs de config qui remplacent les valeurs de default_recognition_config de l'outil de reconnaissance lors de cette requête de reconnaissance. Si aucun masque n'est fourni, tous les champs dont les valeurs ne sont pas celles par défaut dans config remplacent les valeurs de l'outil de reconnaissance pour cette requête de reconnaissance. Si un masque est fourni, seuls les champs affichés correspondent à la configuration de l'outil de reconnaissance pour cette requête de reconnaissance. Si un caractère générique (*) est fourni, config remplace complètement la configuration dans l'outil de reconnaissance pour cette requête de reconnaissance.

streaming_features

StreamingRecognitionFeatures

Fonctionnalités de reconnaissance vocale permettant d'activer des requêtes de reconnaissance audio en streaming spécifiques

StreamingRecognitionFeatures

Fonctionnalités de reconnaissance disponibles spécifiques aux requêtes de reconnaissance en streaming.

Champs
enable_voice_activity_events

bool

Si la valeur est true, les réponses avec des événements vocaux d'activité vocale sont renvoyées au fur et à mesure de leur détection.

interim_results

bool

Indique s'il faut diffuser les résultats intermédiaires au client. Si la valeur est "true", les résultats intermédiaires seront diffusés au client. Sinon, seule la réponse finale sera renvoyée en flux continu.

voice_activity_timeout

VoiceActivityTimeout

Si cette valeur est définie, le serveur ferme automatiquement le flux une fois la durée spécifiée écoulée après l'envoi du dernier événement vocal VOICE_ACTIVITY. Le champ voice_activity_events doit également être défini sur "true".

VoiceActivityTimeout

Événements pour lesquels un délai avant expiration peut être défini pour l'activité Voice.

Champs
speech_start_timeout

Duration

Durée avant expiration du flux si aucune activité vocale ne commence. Si cette valeur est définie et qu'aucune parole n'est détectée pendant cette durée au début du flux, le serveur ferme le flux.

speech_end_timeout

Duration

Durée d'expiration du flux après la fin de la parole. Si cette valeur est définie et qu'aucune parole n'est détectée pendant cette durée après la détection d'une parole, le serveur ferme le flux.

StreamingRecognitionResult

Résultat de reconnaissance vocale correspondant à une partie des données audio en cours de traitement.

Champs
alternatives[]

SpeechRecognitionAlternative

Peut contenir une ou plusieurs hypothèses de reconnaissance. Ces alternatives sont triées par précision, la première alternative étant la plus probable, par l'outil de reconnaissance.

is_final

bool

Si le champ est défini sur false, le résultat StreamingRecognitionResult constitue un élément provisoire susceptible de changer. S'il est défini sur true, c'est la dernière fois que le service vocal renvoie ce résultat StreamingRecognitionResult spécifique. L'outil de reconnaissance ne renverra plus aucune autre hypothèse pour cette partie de la transcription et de l'audio correspondant.

stability

float

Une estimation de la probabilité que l'outil de reconnaissance ne modifie pas sa supposition relative au résultat provisoire. Les valeurs s'étendent de 0,0 (complètement instable) à 1,0 (complètement stable). Ce champ n'est fourni que pour les résultats provisoires (is_final=false). La valeur par défaut de 0.0 est une valeur sentinelle indiquant que la stabilité stability n'a pas été définie.

result_end_offset

Duration

Décalage temporel de la fin de ce résultat par rapport au début de l'audio.

channel_tag

int32

Avec des données audio multicanaux, il s'agit du numéro de canal correspondant au résultat reconnu pour les données audio provenant de ce canal. Si audio_channel_count = N, les valeurs de sortie peuvent aller de 1 à N.

language_code

string

Uniquement en sortie. Le tag de langue BCP-47 dans ce résultat. Ce code de langue a été détecté comme ayant le plus de chances d'être parlé dans l'audio.

StreamingRecognizeRequest

Message de requête pour la méthode StreamingRecognize. Plusieurs messages StreamingRecognizeRequest sont envoyés en un seul appel.

Si le Recognizer référencé par recognizer contient une configuration de requête entièrement spécifiée, le flux ne peut contenir que des messages avec audio défini.

Sinon, le premier message doit contenir un message recognizer et un message streaming_config qui, ensemble, spécifient entièrement la configuration de la requête et ne doivent pas contenir de audio. Tous les messages suivants ne doivent contenir que audio.

Champs
recognizer

string

Obligatoire. Nom de l'outil de reconnaissance à utiliser lors de la reconnaissance. Le format attendu est projects/{project}/locations/{location}/recognizers/{recognizer}. Le segment {recognizer} peut être défini sur _ pour utiliser un outil de reconnaissance implicite vide.

Champ d'union streaming_request.

streaming_request ne peut être qu'un des éléments suivants :

streaming_config

StreamingRecognitionConfig

StreamingRecognitionConfig à utiliser pour cette tentative de reconnaissance. Si elle est fournie, elle remplace la RecognitionConfig par défaut stockée dans l'outil de reconnaissance.

audio

bytes

Octets audio intégrés à reconnaître. La taille maximale de ce champ est de 15 Ko par requête.

StreamingRecognizeResponse

StreamingRecognizeResponse est le seul message renvoyé au client par StreamingRecognize. Une série de zéro messages StreamingRecognizeResponse ou plus est renvoyée au client. S'il n'y a pas d'audio reconnaissable, aucun message n'est retransmis au client.

Voici quelques exemples de StreamingRecognizeResponse pouvant être renvoyées lors du traitement du contenu audio :

  1. results { alternatives { transcript: "tube" } stability: 0.01 }

  2. results { alternatives { transcript: "to be a" } stability: 0.01 }

  3. results { alternatives { transcript: "to be" } stability: 0.9 } results { alternatives { transcript: " or not to be" } stability: 0.01 }

  4. results { alternatives { transcript: "to be or not to be" confidence: 0.92 } alternatives { transcript: "to bee or not to bee" } is_final: true }

  5. results { alternatives { transcript: " that's" } stability: 0.01 }

  6. results { alternatives { transcript: " that is" } stability: 0.9 } results { alternatives { transcript: " the question" } stability: 0.01 }

  7. results { alternatives { transcript: " that is the question" confidence: 0.98 } alternatives { transcript: " that was the question" } is_final: true }

Remarques :

  • Parmi les réponses ci-dessus, seules les lignes 4 et 7 contiennent des résultats finaux, indiqués par is_final: true. En combinant ces réponses, nous obtenons l'intégralité de la transcription : "to be or not to be that is the question" ("être ou ne pas être, telle est la question").

  • Les autres contiennent des results intermédiaires. Les réponses n° 3 et 6 contiennent deux results intermédiaires : la première partie présente une grande stabilité et est moins susceptible de changer. La deuxième partie présente une faible stabilité et est très susceptible de changer. Les concepteurs d'interface utilisateur peuvent choisir de n'afficher que des champs results de stabilité élevée.

  • Les valeurs stability et confidence spécifiques indiquées ci-dessus ne sont données qu'à titre d'exemple. Les valeurs réelles peuvent varier.

  • Dans chaque réponse, un seul de ces champs sera défini : error, speech_event_type ou un ou plusieurs results (répétés).

Champs
results[]

StreamingRecognitionResult

Cette liste répétée contient zéro résultats ou plus, correspondant à des parties consécutives de l'audio en cours de traitement. Elle contient zéro ou un résultat is_final=true (la partie nouvellement configurée), suivi de zéro ou plusieurs résultats is_final=false (les résultats intermédiaires).

speech_event_type

SpeechEventType

Indique le type d'événement de discours.

speech_event_offset

Duration

Décalage temporel entre le début de l'audio et l'émission d'un événement.

metadata

RecognitionResponseMetadata

Métadonnées sur la reconnaissance.

SpeechEventType

Indique le type d'événement de discours.

Énumérations (Enums)
SPEECH_EVENT_TYPE_UNSPECIFIED Aucun événement de discours spécifié.
END_OF_SINGLE_UTTERANCE Cet événement indique que le serveur a détecté la fin de l'énoncé de l'utilisateur et ne s'attend plus à aucune entrée vocale. Le serveur ne traite donc pas de nouvelles données audio et ferme le flux bidirectionnel gRPC. Cet événement n'est envoyé que si la diffusion a été interrompue de force en raison d'un silence détecté plus tôt que prévu. Cet événement n'est disponible que sur latest_short model.
SPEECH_ACTIVITY_BEGIN Cet événement indique que le serveur a détecté le début d'une activité vocale humaine dans le flux. Cet événement peut être renvoyé plusieurs fois si la parole commence et s'arrête à plusieurs reprises tout au long du flux. Cet événement n'est envoyé que si voice_activity_events est défini sur "true".
SPEECH_ACTIVITY_END Cet événement indique que le serveur a détecté la fin de l'activité vocale humaine dans le flux. Cet événement peut être renvoyé plusieurs fois si la parole commence et s'arrête à plusieurs reprises tout au long du flux. Cet événement n'est envoyé que si voice_activity_events est défini sur "true".

TranscriptNormalization

Configuration de la normalisation de la transcription. Utilisez la normalisation de la transcription pour remplacer automatiquement des parties de la transcription par les expressions de votre choix. Pour StreamingRecognize, cette normalisation ne s'applique qu'aux transcriptions partielles stables (stabilité > 0,8) et aux transcriptions finales.

Champs
entries[]

Entry

Liste des entrées de remplacement. Nous effectuerons le remplacement d'une entrée à la fois. Par exemple, la deuxième entrée de ["cat" => "dog", "mountain cat" => "mountain dog"] ne sera jamais appliquée, car nous traiterons toujours la première entrée avant. 100 entrées au maximum.

Entrée

Configuration de remplacement unique.

Champs
search

string

Ce que vous souhaitez remplacer. La longueur maximale est de 100 caractères.

replace

string

Par quoi remplacer le texte. La longueur maximale est de 100 caractères.

case_sensitive

bool

Indique si la recherche est sensible à la casse.

TranslationConfig

Configuration de la traduction. Utilisez-le pour traduire le contenu audio donné en texte dans la langue souhaitée.

Champs
target_language

string

Obligatoire. Code de langue dans laquelle traduire.

UndeleteCustomClassRequest

Message de requête pour la méthode UndeleteCustomClass.

Champs
name

string

Obligatoire. Nom de la CustomClass dont vous souhaitez annuler la suppression. Format : projects/{project}/locations/{location}/customClasses/{custom_class}

validate_only

bool

Si ce champ est défini, validez la requête et prévisualisez la CustomClass dont la suppression a été annulée, mais n'annulez pas sa suppression.

etag

string

Cette somme de contrôle est calculée par le serveur en fonction de la valeur des autres champs. Peut être envoyé lors des requêtes de mise à jour, de restauration et de suppression pour s'assurer que le client dispose d'une valeur à jour avant de continuer.

UndeletePhraseSetRequest

Message de requête pour la méthode UndeletePhraseSet.

Champs
name

string

Obligatoire. Nom de l'ensemble de phrases dont vous souhaitez annuler la suppression. Format : projects/{project}/locations/{location}/phraseSets/{phrase_set}

validate_only

bool

Si ce champ est défini, validez la requête et prévisualisez l'ensemble de phrases restauré, mais n'annulez pas sa suppression.

etag

string

Cette somme de contrôle est calculée par le serveur en fonction de la valeur des autres champs. Peut être envoyé lors des requêtes de mise à jour, de restauration et de suppression pour s'assurer que le client dispose d'une valeur à jour avant de continuer.

UndeleteRecognizerRequest

Message de requête pour la méthode UndeleteRecognizer.

Champs
name

string

Obligatoire. Nom de l'outil de reconnaissance dont vous souhaitez annuler la suppression. Format : projects/{project}/locations/{location}/recognizers/{recognizer}

validate_only

bool

Si ce champ est défini, validez la requête et prévisualisez l'outil de reconnaissance restauré, mais n'annulez pas sa suppression.

etag

string

Cette somme de contrôle est calculée par le serveur en fonction de la valeur des autres champs. Peut être envoyé lors des requêtes de mise à jour, de restauration et de suppression pour s'assurer que le client dispose d'une valeur à jour avant de continuer.

UpdateConfigRequest

Message de requête pour la méthode UpdateConfig.

Champs
config

Config

Obligatoire. Configuration à mettre à jour.

Le champ name de la configuration permet d'identifier la configuration à mettre à jour. Le format attendu est projects/{project}/locations/{location}/config.

update_mask

FieldMask

Liste des champs à mettre à jour.

UpdateCustomClassRequest

Message de requête pour la méthode UpdateCustomClass.

Champs
custom_class

CustomClass

Obligatoire. La CustomClass à mettre à jour.

Le champ name de la CustomClass permet d'identifier la CustomClass à mettre à jour. Format : projects/{project}/locations/{location}/customClasses/{custom_class}.

update_mask

FieldMask

Liste des champs à mettre à jour. Si ce paramètre est vide, tous les champs sont pris en compte pour la mise à jour.

validate_only

bool

Si ce champ est défini, vous validez la requête et prévisualisez la CustomClass mise à jour, mais ne la mettez pas à jour réellement.

UpdatePhraseSetRequest

Message de requête pour la méthode UpdatePhraseSet.

Champs
phrase_set

PhraseSet

Obligatoire. Ensemble de phrases à mettre à jour.

Le champ name de l'ensemble de phrases permet d'identifier l'ensemble de phrases à mettre à jour. Format : projects/{project}/locations/{location}/phraseSets/{phrase_set}.

update_mask

FieldMask

Liste des champs à mettre à jour. Si ce champ est vide, tous les champs dont la valeur n'est pas celle par défaut sont considérés comme devant être mis à jour. Utilisez * pour mettre à jour l'intégralité de la ressource PhraseSet.

validate_only

bool

Si ce champ est défini, validez la requête et prévisualisez l'ensemble de phrases mis à jour, mais ne le mettez pas à jour réellement.

UpdateRecognizerRequest

Message de requête pour la méthode UpdateRecognizer.

Champs
recognizer

Recognizer

Obligatoire. Outil de reconnaissance à mettre à jour.

Le champ name de l'outil de reconnaissance permet d'identifier l'outil de reconnaissance à mettre à jour. Format : projects/{project}/locations/{location}/recognizers/{recognizer}.

update_mask

FieldMask

Liste des champs à mettre à jour. Si ce champ est vide, tous les champs dont la valeur n'est pas celle par défaut sont considérés comme devant être mis à jour. Utilisez * pour mettre à jour l'intégralité de la ressource d'outil de reconnaissance.

validate_only

bool

Si ce champ est défini, validez la requête et prévisualisez l'outil de reconnaissance mis à jour, mais ne le mettez pas à jour réellement.

VttOutputFileFormatConfig

Ce type ne comporte aucun champ.

Configurations de sortie pour le fichier de sous-titres au format WebVTT.

WordInfo

Informations spécifiques au mot pour les mots reconnus.

Champs
start_offset

Duration

Décalage temporel relatif au début des données audio et correspondant au début du mot prononcé. Ce champ n'est défini que si enable_word_time_offsets est true, et uniquement dans la première hypothèse. Il s'agit d'une fonctionnalité expérimentale. La précision du décalage temporel peut varier.

end_offset

Duration

Décalage temporel relatif au début des données audio et correspondant à la fin du mot prononcé. Ce champ n'est défini que si enable_word_time_offsets est true, et uniquement dans la première hypothèse. Il s'agit d'une fonctionnalité expérimentale. La précision du décalage temporel peut varier.

word

string

Mot correspondant à cet ensemble d'informations.

confidence

float

Estimation de fiabilité comprise entre 0,0 et 1,0. Un nombre élevé indique une plus grande probabilité estimée que les mots reconnus soient corrects. Ce champ n'est défini que pour la première alternative d'un résultat n'étant pas sous forme de flux, ou d'un résultat de flux dans lequel is_final est défini sur true. La précision de ce champ n'est pas garantie. Les utilisateurs ne devraient pas s'attendre à ce qu'il soit toujours fourni. La valeur par défaut de 0,0 est une valeur sentinelle indiquant que la valeur confidence n'a pas été définie.

speaker_label

string

Un libellé distinct est attribué à chaque locuteur dans l'audio. Ce champ spécifie lequel de ces locuteurs a été détecté pour avoir prononcé ce mot. speaker_label est défini si SpeakerDiarizationConfig est spécifié, et uniquement dans la première alternative.