Index
Speech(interface)AccessMetadata(message)AccessMetadata.ConstraintType(enum)AutoDetectDecodingConfig(message)BatchRecognizeFileMetadata(message)BatchRecognizeFileResult(message)BatchRecognizeMetadata(message)BatchRecognizeRequest(message)BatchRecognizeRequest.ProcessingStrategy(enum)BatchRecognizeResponse(message)BatchRecognizeResults(message)BatchRecognizeTranscriptionMetadata(message)CloudStorageResult(message)Config(message)CreateCustomClassRequest(message)CreatePhraseSetRequest(message)CreateRecognizerRequest(message)CustomClass(message)CustomClass.ClassItem(message)CustomClass.State(enum)DeleteCustomClassRequest(message)DeletePhraseSetRequest(message)DeleteRecognizerRequest(message)DenoiserConfig(message)ExplicitDecodingConfig(message)ExplicitDecodingConfig.AudioEncoding(enum)GcsOutputConfig(message)GetConfigRequest(message)GetCustomClassRequest(message)GetPhraseSetRequest(message)GetRecognizerRequest(message)InlineOutputConfig(message)InlineResult(message)LanguageMetadata(message)ListCustomClassesRequest(message)ListCustomClassesResponse(message)ListPhraseSetsRequest(message)ListPhraseSetsResponse(message)ListRecognizersRequest(message)ListRecognizersResponse(message)LocationsMetadata(message)ModelFeature(message)ModelFeatures(message)ModelMetadata(message)NativeOutputFileFormatConfig(message)OperationMetadata(message)OutputFormatConfig(message)PhraseSet(message)PhraseSet.Phrase(message)PhraseSet.State(enum)RecognitionConfig(message)RecognitionFeatures(message)RecognitionFeatures.MultiChannelMode(enum)RecognitionOutputConfig(message)RecognitionResponseMetadata(message)RecognizeRequest(message)RecognizeResponse(message)Recognizer(message)Recognizer.State(enum)SpeakerDiarizationConfig(message)SpeechAdaptation(message)SpeechAdaptation.AdaptationPhraseSet(message)SpeechRecognitionAlternative(message)SpeechRecognitionResult(message)SrtOutputFileFormatConfig(message)StreamingRecognitionConfig(message)StreamingRecognitionFeatures(message)StreamingRecognitionFeatures.VoiceActivityTimeout(message)StreamingRecognitionResult(message)StreamingRecognizeRequest(message)StreamingRecognizeResponse(message)StreamingRecognizeResponse.SpeechEventType(enum)TranscriptNormalization(message)TranscriptNormalization.Entry(message)TranslationConfig(message)UndeleteCustomClassRequest(message)UndeletePhraseSetRequest(message)UndeleteRecognizerRequest(message)UpdateConfigRequest(message)UpdateCustomClassRequest(message)UpdatePhraseSetRequest(message)UpdateRecognizerRequest(message)VttOutputFileFormatConfig(message)WordInfo(message)
Voix
Permet la transcription vocale et la gestion des ressources.
| BatchRecognize |
|---|
|
Effectue une reconnaissance vocale asynchrone par lot : envoie une requête avec N fichiers audio et reçoit une opération de longue durée qui peut être interrogée pour savoir quand les transcriptions sont terminées.
|
| CreateCustomClass |
|---|
|
Crée un objet
|
| CreatePhraseSet |
|---|
|
Crée un objet
|
| CreateRecognizer |
|---|
|
Crée un objet
|
| DeleteCustomClass |
|---|
|
Supprime le
|
| DeletePhraseSet |
|---|
|
Supprime le
|
| DeleteRecognizer |
|---|
|
Supprime le
|
| GetConfig |
|---|
|
Renvoie le
|
| GetCustomClass |
|---|
|
Renvoie le
|
| GetPhraseSet |
|---|
|
Renvoie le
|
| GetRecognizer |
|---|
|
Renvoie le
|
| ListCustomClasses |
|---|
|
Répertorie les objets CustomClasses.
|
| ListPhraseSets |
|---|
|
Liste les ensembles de phrases.
|
| ListRecognizers |
|---|
|
Répertorie les outils de reconnaissance.
|
| Reconnaissance |
|---|
|
Effectue une reconnaissance vocale synchrone : recevez les résultats après que toutes les données audio ont été envoyées et traitées.
|
| StreamingRecognize |
|---|
|
Effectue une reconnaissance vocale en continu bidirectionnelle : recevez les résultats tout en envoyant les données audio. Cette méthode n'est disponible que via l'API gRPC (non REST).
|
| UndeleteCustomClass |
|---|
|
Restaure le
|
| UndeletePhraseSet |
|---|
|
Restaure le
|
| UndeleteRecognizer |
|---|
|
Restaure le
|
| UpdateConfig |
|---|
|
Met à jour l'objet
|
| UpdateCustomClass |
|---|
|
Met à jour l'objet
|
| UpdatePhraseSet |
|---|
|
Met à jour l'objet
|
| UpdateRecognizer |
|---|
|
Met à jour l'objet
|
AccessMetadata
Métadonnées d'accès pour une région spécifique. Cela peut être appliqué si la règle d'administration pour le projet donné n'autorise pas une région spécifique.
| Champs | |
|---|---|
constraint_type |
Décrit les différents types de contraintes appliquées. |
ConstraintType
Décrit les différents types de contraintes pouvant être appliquées à une région.
| Enums | |
|---|---|
CONSTRAINT_TYPE_UNSPECIFIED |
Une contrainte non spécifiée a été appliquée. |
RESOURCE_LOCATIONS_ORG_POLICY_CREATE_CONSTRAINT |
Les règles de l'organisation du projet n'autorisent pas la région indiquée. |
AutoDetectDecodingConfig
Ce type ne comporte aucun champ.
Paramètres de décodage détectés automatiquement. Compatible avec les encodages suivants :
WAV_LINEAR16 : échantillons PCM little-endian de 16 bits signés dans un conteneur WAV.
WAV_MULAW : échantillons mulaw compressés de 8 bits dans un conteneur WAV.
WAV_ALAW : échantillons alaw compressés de 8 bits dans un conteneur WAV.
RFC4867_5_AMR : trames AMR avec un en-tête rfc4867.5.
RFC4867_5_AMRWB : trames AMR-WB avec un en-tête rfc4867.5.
FLAC : trames FLAC au format de conteneur "FLAC natif".
MP3 : frames audio MPEG avec métadonnées ID3 facultatives (ignorées).
OGG_OPUS : trames audio Opus dans un conteneur Ogg.
WEBM_OPUS : trames audio Opus dans un conteneur WebM.
MP4_AAC : trames audio AAC dans un conteneur MP4.
M4A_AAC : trames audio AAC dans un conteneur M4A.
MOV_AAC : trames audio AAC dans un conteneur MOV.
BatchRecognizeFileMetadata
Métadonnées concernant un seul fichier dans un lot pour BatchRecognize.
| Champs | |
|---|---|
config |
Fonctionnalités et métadonnées audio à utiliser pour la reconnaissance vocale automatique. Ce champ, associé au champ |
config_mask |
Liste des champs de |
Champ d'union audio_source. Correspond à la source audio, qui se présente sous la forme d'un URI Google Cloud Storage. audio_source ne peut être qu'un des éléments suivants : |
|
uri |
URI Cloud Storage du fichier audio. |
BatchRecognizeFileResult
Résultats finaux pour un seul fichier.
| Champs | |
|---|---|
error |
Erreur, le cas échéant. |
metadata |
|
uri |
Obsolète. Utilisez plutôt |
transcript |
Obsolète. Utilisez plutôt |
Champ d'union
|
|
cloud_storage_result |
Résultats de reconnaissance écrits dans Cloud Storage. Ce champ n'est renseigné que lorsque |
inline_result |
Résultats de la reconnaissance. Ce champ n'est renseigné que lorsque |
BatchRecognizeMetadata
Métadonnées de l'opération pour BatchRecognize.
| Champs | |
|---|---|
transcription_metadata |
Mapper le nom de fichier fourni aux métadonnées de transcription de ce fichier. |
BatchRecognizeRequest
Message de requête pour la méthode BatchRecognize.
| Champs | |
|---|---|
recognizer |
Obligatoire. Nom de l'outil de reconnaissance à utiliser lors de la reconnaissance. Le format attendu est |
config |
Fonctionnalités et métadonnées audio à utiliser pour la reconnaissance vocale automatique. Ce champ, associé au champ |
config_mask |
Liste des champs de |
files[] |
Fichiers audio avec métadonnées pour la reconnaissance vocale. Vous pouvez spécifier un maximum de 15 fichiers. |
recognition_output_config |
Options de configuration permettant de spécifier où afficher les transcriptions de chaque fichier. |
processing_strategy |
Stratégie de traitement à utiliser pour cette requête. |
ProcessingStrategy
Stratégies de traitement possibles pour les requêtes par lot.
| Enums | |
|---|---|
PROCESSING_STRATEGY_UNSPECIFIED |
Valeur par défaut de la stratégie de traitement. La demande est traitée dès sa réception. |
DYNAMIC_BATCHING |
Si cette option est sélectionnée, la requête est traitée pendant les périodes de faible utilisation pour bénéficier d'une remise. La demande est traitée dans les 24 heures. |
BatchRecognizeResponse
Message de réponse pour BatchRecognize, qui est inclus dans un Operation de longue durée.
| Champs | |
|---|---|
results |
Mapper le nom de fichier au résultat final de ce fichier. |
total_billed_duration |
Le cas échéant, secondes audio facturées pour la requête correspondante. |
BatchRecognizeResults
Type de sortie pour Cloud Storage des transcriptions BatchRecognize. Bien que ce fichier proto ne soit renvoyé nulle part dans cette API, les transcriptions Cloud Storage seront sérialisées dans ce fichier et doivent être analysées comme tel.
| Champs | |
|---|---|
results[] |
Liste séquentielle des résultats de transcription correspondant à des parties séquentielles de l'audio. |
metadata |
Métadonnées sur la reconnaissance. |
BatchRecognizeTranscriptionMetadata
Métadonnées sur la transcription d'un seul fichier (par exemple, le pourcentage de progression).
| Champs | |
|---|---|
progress_percent |
Quantité de fichiers transcrits jusqu'à présent. |
error |
Erreur, le cas échéant. |
uri |
URI Cloud Storage dans lequel les résultats de la reconnaissance seront écrits. |
CloudStorageResult
Résultats finaux écrits dans Cloud Storage.
| Champs | |
|---|---|
uri |
URI Cloud Storage dans lequel les résultats de la reconnaissance ont été écrits. |
vtt_format_uri |
URI Cloud Storage dans lequel les résultats de la reconnaissance ont été écrits sous forme de sous-titres au format VTT. Ce champ n'est renseigné que lorsque la sortie |
srt_format_uri |
URI Cloud Storage dans lequel les résultats de la reconnaissance ont été écrits sous forme de sous-titres au format SRT. Ce champ n'est renseigné que lorsque la sortie |
Config
Message représentant la configuration de l'API Speech-to-Text. Cela inclut une clé KMS facultative avec laquelle les données entrantes seront chiffrées.
| Champs | |
|---|---|
name |
Uniquement en sortie. Identifiant. Nom de la ressource de configuration. Il existe exactement une ressource de configuration par projet et par emplacement. Le format attendu est |
kms_key_name |
Facultatif. Nom de clé KMS facultatif qui, le cas échéant, sera utilisé pour chiffrer les ressources Speech-to-Text au repos. La mise à jour de cette clé n'aura pas pour effet de chiffrer les ressources existantes à l'aide de cette clé. Seules les nouvelles ressources seront chiffrées à l'aide de cette clé. Le format attendu est |
update_time |
Uniquement en sortie. Heure de la dernière modification de cette ressource. |
CreateCustomClassRequest
Message de requête pour la méthode CreateCustomClass.
| Champs | |
|---|---|
custom_class |
Obligatoire. CustomClass à créer. |
validate_only |
Si ce champ est défini, validez la requête et prévisualisez la CustomClass, mais ne la créez pas réellement. |
custom_class_id |
ID à utiliser pour la CustomClass, qui constituera le composant final du nom de ressource de la CustomClass. Cette valeur doit contenir entre 1 et 63 caractères, et les caractères valides sont /[az][0-9]-/. |
parent |
Obligatoire. Projet et emplacement dans lesquels cette CustomClass sera créée. Le format attendu est |
CreatePhraseSetRequest
Message de requête pour la méthode CreatePhraseSet.
| Champs | |
|---|---|
phrase_set |
Obligatoire. Ensemble de phrases à créer. |
validate_only |
Si ce champ est défini, validez la requête et prévisualisez l'ensemble de phrases, mais ne le créez pas réellement. |
phrase_set_id |
ID à utiliser pour l'ensemble de phrases, qui constituera le composant final du nom de ressource de l'ensemble de phrases. Cette valeur doit contenir entre 1 et 63 caractères, et les caractères valides sont /[az][0-9]-/. |
parent |
Obligatoire. Projet et emplacement dans lesquels cet ensemble de phrases sera créé. Le format attendu est |
CreateRecognizerRequest
Message de requête pour la méthode CreateRecognizer.
| Champs | |
|---|---|
recognizer |
Obligatoire. Programme de reconnaissance à créer. |
validate_only |
Si ce champ est défini, validez la requête et prévisualisez l'outil de reconnaissance, mais ne le créez pas réellement. |
recognizer_id |
ID à utiliser pour l'outil de reconnaissance, qui constituera le composant final du nom de ressource de l'outil de reconnaissance. Cette valeur doit contenir entre 1 et 63 caractères, et les caractères valides sont /[az][0-9]-/. |
parent |
Obligatoire. Projet et emplacement dans lesquels cet outil de reconnaissance sera créé. Le format attendu est |
CustomClass
CustomClass pour la pondération de la reconnaissance vocale. Permet de définir un ensemble de mots ou d'expressions représentant un concept ou un thème commun susceptible d'apparaître dans votre contenu audio, par exemple une liste de noms de navires à passagers.
| Champs | |
|---|---|
name |
Uniquement en sortie. Identifiant. Nom de ressource de la CustomClass. Format : |
uid |
Uniquement en sortie. Identifiant unique attribué par le système pour CustomClass. |
display_name |
Facultatif. Nom lisible et défini par l'utilisateur pour l'objet CustomClass. L'ID ne doit pas contenir plus de 63 caractères |
items[] |
Collection d'éléments de cours. |
state |
Uniquement en sortie. État du cycle de vie de l'objet CustomClass. |
create_time |
Uniquement en sortie. Heure de création. |
update_time |
Uniquement en sortie. Heure de la dernière modification de cette ressource. |
delete_time |
Uniquement en sortie. Heure à laquelle la suppression de cette ressource a été demandée. |
expire_time |
Uniquement en sortie. Heure à laquelle cette ressource sera supprimée. |
annotations |
Facultatif. Permet aux utilisateurs de stocker de petites quantités de données arbitraires. La clé et la valeur ne doivent pas comporter plus de 63 caractères chacune. 100 annotations au maximum. |
etag |
Uniquement en sortie. Cette somme de contrôle est calculée par le serveur en fonction de la valeur des autres champs. Peut être envoyé lors des requêtes de mise à jour, de restauration et de suppression pour s'assurer que le client dispose d'une valeur à jour avant de continuer. |
reconciling |
Uniquement en sortie. Indique si cet objet CustomClass est en cours de mise à jour. |
kms_key_name |
Uniquement en sortie. Nom de la clé KMS avec laquelle l'objet CustomClass est chiffré. Le format attendu est |
kms_key_version_name |
Uniquement en sortie. Nom de la version de clé KMS avec laquelle l'objet CustomClass est chiffré. Le format attendu est |
ClassItem
Élément de la classe.
| Champs | |
|---|---|
value |
Valeur de l'élément de classe. |
État
Ensemble d'états qui définissent le cycle de vie d'un objet CustomClass.
| Enums | |
|---|---|
STATE_UNSPECIFIED |
État non spécifié. Cette valeur n'est utilisée/utile que pour distinguer les valeurs non définies. |
ACTIVE |
État normal et actif. |
DELETED |
Cet objet CustomClass a été supprimé. |
DeleteCustomClassRequest
Message de requête pour la méthode DeleteCustomClass.
| Champs | |
|---|---|
name |
Obligatoire. Nom de la CustomClass à supprimer. Format : |
validate_only |
Si ce champ est défini, validez la requête et prévisualisez la CustomClass supprimée, mais ne la supprimez pas réellement. |
allow_missing |
Si la valeur est définie sur "true" et que la CustomClass est introuvable, la requête aboutit et est une opération "no-op" (aucune opération n'est enregistrée dans ce cas). |
etag |
Cette somme de contrôle est calculée par le serveur en fonction de la valeur des autres champs. Peut être envoyé lors des requêtes de mise à jour, de restauration et de suppression pour s'assurer que le client dispose d'une valeur à jour avant de continuer. |
DeletePhraseSetRequest
Message de requête pour la méthode DeletePhraseSet.
| Champs | |
|---|---|
name |
Obligatoire. Nom de l'ensemble de phrases à supprimer. Format : |
validate_only |
Si ce champ est défini, validez la requête et prévisualisez l'ensemble de phrases supprimé, mais ne le supprimez pas réellement. |
allow_missing |
Si la valeur est définie sur "true" et que l'ensemble de phrases est introuvable, la requête aboutit et est une no-op (aucune opération n'est enregistrée dans ce cas). |
etag |
Cette somme de contrôle est calculée par le serveur en fonction de la valeur des autres champs. Peut être envoyé lors des requêtes de mise à jour, de restauration et de suppression pour s'assurer que le client dispose d'une valeur à jour avant de continuer. |
DeleteRecognizerRequest
Message de requête pour la méthode DeleteRecognizer.
| Champs | |
|---|---|
name |
Obligatoire. Nom de l'outil de reconnaissance à supprimer. Format : |
validate_only |
Si ce champ est défini, validez la requête et prévisualisez l'outil de reconnaissance supprimé, mais ne le supprimez pas réellement. |
allow_missing |
Si la valeur est définie sur "true" et que l'outil de reconnaissance est introuvable, la requête aboutit et est une opération "no-op" (aucune opération n'est enregistrée dans ce cas). |
etag |
Cette somme de contrôle est calculée par le serveur en fonction de la valeur des autres champs. Peut être envoyé lors des requêtes de mise à jour, de restauration et de suppression pour s'assurer que le client dispose d'une valeur à jour avant de continuer. |
DenoiserConfig
Configuration de la suppression du bruit. Cette fonctionnalité n'est peut-être pas disponible pour tous les modèles et peut n'avoir aucun effet.
| Champs | |
|---|---|
denoise_audio |
Supprimez le bruit de l'audio avant de l'envoyer au modèle de transcription. |
snr_threshold |
Seuil de rapport signal/bruit (SNR) pour le débruiteur. Ici, le SNR désigne le volume du signal vocal. L'audio dont le SNR est inférieur à ce seuil (c'est-à-dire dont la parole est trop faible) ne pourra pas être envoyé au modèle de transcription. Si snr_threshold=0, aucun filtrage ne sera appliqué. |
ExplicitDecodingConfig
Paramètres de décodage spécifiés explicitement.
| Champs | |
|---|---|
encoding |
Obligatoire. Encodage des données audio envoyées pour la reconnaissance. |
sample_rate_hertz |
Facultatif. Taux d'échantillonnage en hertz des données audio envoyées pour la reconnaissance. Les valeurs valides sont comprises entre 8 000 et 48 000. La valeur optimale est 16 000. Pour de meilleurs résultats, définissez le taux d'échantillonnage de la source audio sur 16 000 Hz. Si ce n'est pas possible, utilisez le taux d'échantillonnage natif de la source audio (plutôt que d'effectuer un ré-échantillonnage). Notez que ce champ est marqué comme FACULTATIF pour des raisons de rétrocompatibilité. Elle est (et a toujours été) effectivement OBLIGATOIRE. |
audio_channel_count |
Facultatif. Nombre de canaux présents dans les données audio envoyées pour la reconnaissance. Notez que ce champ est marqué comme FACULTATIF pour des raisons de rétrocompatibilité. Elle est (et a toujours été) effectivement OBLIGATOIRE. La valeur maximale autorisée est de 8. |
AudioEncoding
Encodages de données audio compatibles.
| Enums | |
|---|---|
AUDIO_ENCODING_UNSPECIFIED |
Valeur par défaut. Cette valeur n'est pas utilisée. |
LINEAR16 |
Échantillons PCM little-endian de 16 bits signés sans en-tête. |
MULAW |
Échantillons MULAW compressés de 8 bits sans en-tête. |
ALAW |
Échantillons alaw compressés de 8 bits sans en-tête. |
AMR |
Frames AMR avec un en-tête rfc4867.5. |
AMR_WB |
Frames AMR-WB avec un en-tête rfc4867.5. |
FLAC |
Frames FLAC au format de conteneur "FLAC natif". |
MP3 |
Frames audio MPEG avec métadonnées ID3 facultatives (ignorées). |
OGG_OPUS |
Trames audio Opus dans un conteneur Ogg. |
WEBM_OPUS |
Trames audio Opus dans un conteneur WebM. |
MP4_AAC |
Trames audio AAC dans un conteneur MP4. |
M4A_AAC |
Trames audio AAC dans un conteneur M4A. |
MOV_AAC |
Trames audio AAC dans un conteneur MOV. |
GcsOutputConfig
Configurations de sortie pour Cloud Storage.
| Champs | |
|---|---|
uri |
Préfixe d'URI Cloud Storage avec lequel les résultats de la reconnaissance seront écrits. |
GetConfigRequest
Message de requête pour la méthode GetConfig.
| Champs | |
|---|---|
name |
Obligatoire. Nom de la configuration à récupérer. Il existe exactement une ressource de configuration par projet et par emplacement. Le format attendu est |
GetCustomClassRequest
Message de requête pour la méthode GetCustomClass.
| Champs | |
|---|---|
name |
Obligatoire. Nom de la CustomClass à récupérer. Le format attendu est |
GetPhraseSetRequest
Message de requête pour la méthode GetPhraseSet.
| Champs | |
|---|---|
name |
Obligatoire. Nom de l'ensemble de phrases à récupérer. Le format attendu est |
GetRecognizerRequest
Message de requête pour la méthode GetRecognizer.
| Champs | |
|---|---|
name |
Obligatoire. Nom de l'outil de reconnaissance à récupérer. Le format attendu est |
InlineOutputConfig
Ce type ne comporte aucun champ.
Configurations de sortie pour la réponse intégrée.
InlineResult
Les résultats finaux sont renvoyés en ligne dans la réponse de reconnaissance.
| Champs | |
|---|---|
transcript |
Transcription du fichier audio. |
vtt_captions |
Transcription du fichier audio sous forme de sous-titres au format VTT. Ce champ n'est renseigné que lorsque la sortie |
srt_captions |
Transcription du fichier audio sous forme de sous-titres au format SRT. Ce champ n'est renseigné que lorsque la sortie |
LanguageMetadata
Métadonnées sur les paramètres régionaux disponibles dans une région donnée. Actuellement, il s'agit uniquement des modèles disponibles pour chaque paramètre régional.
| Champs | |
|---|---|
models |
Mappage des paramètres régionaux (code de langue) aux modèles |
ListCustomClassesRequest
Message de requête pour la méthode ListCustomClasses.
| Champs | |
|---|---|
parent |
Obligatoire. Projet et emplacement des ressources CustomClass à lister. Le format attendu est |
page_size |
Nombre de résultats par requête. Une valeur page_size valide est comprise entre 0 et 100 (inclus). Si la valeur de page_size est nulle ou non spécifiée, une taille de page de 5 sera choisie. Si la taille de la page dépasse 100, elle sera réduite à 100. Notez qu'un appel peut renvoyer moins de résultats que la taille de page demandée. |
page_token |
Jeton de page reçu d'un appel Lors de la pagination, tous les autres paramètres fournis à |
show_deleted |
Indique si les ressources supprimées doivent être affichées ou non. |
ListCustomClassesResponse
Message de réponse pour la méthode ListCustomClasses.
| Champs | |
|---|---|
custom_classes[] |
Liste des CustomClasses demandées. |
next_page_token |
Jeton pouvant être envoyé en tant que |
ListPhraseSetsRequest
Message de requête pour la méthode ListPhraseSets.
| Champs | |
|---|---|
parent |
Obligatoire. Projet et emplacement des ressources PhraseSet à lister. Le format attendu est |
page_size |
Nombre maximal de PhraseSets à renvoyer. Le service peut renvoyer un nombre inférieur à cette valeur. Si aucune valeur n'est spécifiée, cinq ensembles d'expressions au maximum sont renvoyés. La valeur maximale est 100. Les valeurs supérieures sont réduites à 100. |
page_token |
Jeton de page reçu d'un appel Lors de la pagination, tous les autres paramètres fournis à |
show_deleted |
Indique si les ressources supprimées doivent être affichées ou non. |
ListPhraseSetsResponse
Message de réponse pour la méthode ListPhraseSets.
| Champs | |
|---|---|
phrase_sets[] |
Liste des PhraseSets demandés. |
next_page_token |
Jeton pouvant être envoyé en tant que |
ListRecognizersRequest
Message de requête pour la méthode ListRecognizers.
| Champs | |
|---|---|
parent |
Obligatoire. Projet et emplacement des outils de reconnaissance à lister. Le format attendu est |
page_size |
Nombre maximal de Recognizers à renvoyer. Le service peut renvoyer un nombre inférieur à cette valeur. Si aucune valeur n'est spécifiée, cinq éléments Recognizer au maximum sont renvoyés. La valeur maximale est 100. Les valeurs supérieures sont réduites à 100. |
page_token |
Jeton de page reçu d'un appel Lors de la pagination, tous les autres paramètres fournis à |
show_deleted |
Indique si les ressources supprimées doivent être affichées ou non. |
ListRecognizersResponse
Message de réponse pour la méthode ListRecognizers.
| Champs | |
|---|---|
recognizers[] |
Liste des outils de reconnaissance demandés. |
next_page_token |
Jeton pouvant être envoyé en tant que |
LocationsMetadata
Métadonnées principales de l'API Locations pour STT V2. Actuellement, il s'agit uniquement des métadonnées sur les paramètres régionaux, les modèles et les fonctionnalités.
| Champs | |
|---|---|
languages |
Informations sur les paramètres régionaux, les modèles et les fonctionnalités disponibles, représentées dans la structure hiérarchique des paramètres régionaux > modèles > fonctionnalités |
access_metadata |
Informations sur les métadonnées d'accès pour la région et le projet concernés. |
ModelFeature
Représente une caractéristique unique d'un modèle. Si la fonctionnalité est recognizer, l'état de publication de la fonctionnalité représente l'état de publication du modèle.
| Champs | |
|---|---|
feature |
Nom de la fonctionnalité (remarque : la fonctionnalité peut être |
release_state |
État de la fonctionnalité |
ModelFeatures
Représente la collection de caractéristiques appartenant à un modèle.
| Champs | |
|---|---|
model_feature[] |
Champ répété contenant toutes les caractéristiques du modèle |
ModelMetadata
Métadonnées sur les modèles dans une région donnée pour un paramètre régional spécifique. Actuellement, il s'agit uniquement des caractéristiques du modèle.
| Champs | |
|---|---|
model_features |
Mappage du nom du modèle aux caractéristiques de ce modèle |
NativeOutputFileFormatConfig
Ce type ne comporte aucun champ.
Configurations de sortie pour les protos BatchRecognizeResults sérialisés.
OperationMetadata
Représente les métadonnées d'une opération de longue durée.
| Champs | |
|---|---|
create_time |
Heure à laquelle l'opération a été créée. |
update_time |
Date et heure de la dernière mise à jour de l'opération. |
resource |
Chemin d'accès à la ressource pour la cible de l'opération. |
method |
Méthode ayant déclenché l'opération. |
kms_key_name |
Nom de la clé KMS avec laquelle le contenu de l'opération est chiffré. Le format attendu est |
kms_key_version_name |
Nom de la version de clé KMS avec laquelle le contenu de l'opération est chiffré. Le format attendu est |
progress_percent |
Pourcentage de progression de l'opération. Les valeurs peuvent être comprises entre 0 et 100. Si la valeur est de 100, l'opération est terminée. |
Champ d'union request. Requête qui a généré l'opération. request ne peut être qu'un des éléments suivants : |
|
batch_recognize_request |
BatchRecognizeRequest qui a généré l'opération. |
create_recognizer_request |
CreateRecognizerRequest qui a généré l'opération. |
update_recognizer_request |
UpdateRecognizerRequest qui a généré l'opération. |
delete_recognizer_request |
DeleteRecognizerRequest qui a généré l'opération. |
undelete_recognizer_request |
UndeleteRecognizerRequest qui a généré l'opération. |
create_custom_class_request |
CreateCustomClassRequest qui a généré l'opération. |
update_custom_class_request |
UpdateCustomClassRequest qui a généré l'opération. |
delete_custom_class_request |
DeleteCustomClassRequest qui a généré l'opération. |
undelete_custom_class_request |
UndeleteCustomClassRequest qui a généré l'opération. |
create_phrase_set_request |
CreatePhraseSetRequest qui a généré l'opération. |
update_phrase_set_request |
UpdatePhraseSetRequest qui a généré l'opération. |
delete_phrase_set_request |
DeletePhraseSetRequest qui a généré l'opération. |
undelete_phrase_set_request |
UndeletePhraseSetRequest qui a généré l'opération. |
update_config_request |
UpdateConfigRequest qui a généré l'opération. |
Champ d'union metadata. Métadonnées spécifiques à chaque RPC. metadata ne peut être qu'un des éléments suivants : |
|
batch_recognize_metadata |
Métadonnées spécifiques à la méthode BatchRecognize. |
OutputFormatConfig
Configuration du format des résultats stockés dans output.
| Champs | |
|---|---|
native |
Configuration du format de sortie natif. Si ce champ est défini ou si aucun autre champ de format de sortie n'est défini, les transcriptions seront écrites dans le récepteur au format natif. |
vtt |
Configuration du format de sortie VTT. Si ce champ est défini, les transcriptions sont écrites dans le récepteur au format VTT. |
srt |
Configuration du format de sortie SRT. Si ce champ est défini, les transcriptions sont écrites dans le récepteur au format SRT. |
PhraseSet
PhraseSet pour la pondération de la reconnaissance vocale. Un PhraseSet est utilisé pour fournir des "indices" à l'outil de reconnaissance vocale afin de privilégier certains mots et expressions dans les résultats.
| Champs | |
|---|---|
name |
Uniquement en sortie. Identifiant. Nom de ressource du PhraseSet. Format : |
uid |
Uniquement en sortie. Identifiant unique attribué par le système pour le PhraseSet. |
phrases[] |
Une liste de mots et d'expressions. |
boost |
Boost d'indices Une valeur positive augmentera la probabilité qu'une expression spécifique soit reconnue par rapport à d'autres expressions similaires. Plus le boost est élevé, plus le risque de faux positif est élevé. Les valeurs |
display_name |
Nom lisible et défini par l'utilisateur pour l'objet PhraseSet. L'ID ne doit pas contenir plus de 63 caractères |
state |
Uniquement en sortie. État du cycle de vie de PhraseSet. |
create_time |
Uniquement en sortie. Heure de création. |
update_time |
Uniquement en sortie. Heure de la dernière modification de cette ressource. |
delete_time |
Uniquement en sortie. Heure à laquelle la suppression de cette ressource a été demandée. |
expire_time |
Uniquement en sortie. Heure à laquelle cette ressource sera supprimée. |
annotations |
Permet aux utilisateurs de stocker de petites quantités de données arbitraires. La clé et la valeur ne doivent pas comporter plus de 63 caractères chacune. 100 annotations au maximum. |
etag |
Uniquement en sortie. Cette somme de contrôle est calculée par le serveur en fonction de la valeur des autres champs. Peut être envoyé lors des requêtes de mise à jour, de restauration et de suppression pour s'assurer que le client dispose d'une valeur à jour avant de continuer. |
reconciling |
Uniquement en sortie. Indique si cet objet PhraseSet est en cours de mise à jour. |
kms_key_name |
Uniquement en sortie. Nom de la clé KMS avec laquelle PhraseSet est chiffré. Le format attendu est |
kms_key_version_name |
Uniquement en sortie. Nom de la version de clé KMS avec laquelle le PhraseSet est chiffré. Le format attendu est |
Expression
Une expression contient des mots et des expressions qui fournissent des indications afin que la reconnaissance vocale soit plus susceptible de les reconnaître. Cette liste permet d'améliorer la précision de certains termes et phrases, notamment dans des commandes spécifiques généralement prononcées par l'utilisateur. Elle offre également la possibilité d'ajouter des mots supplémentaires au vocabulaire de l'outil de reconnaissance.
Les éléments de liste peuvent également inclure des références CustomClass contenant des groupes de mots qui représentent des concepts courants dans le langage naturel.
| Champs | |
|---|---|
value |
L'expression elle-même. |
boost |
Boost d'indices Remplace l'amélioration définie au niveau de l'ensemble d'expressions. Une valeur positive augmentera la probabilité qu'une expression spécifique soit reconnue par rapport à d'autres expressions similaires. Plus le boost est élevé, plus le risque de faux positif est élevé. Les valeurs de boost négatives correspondent à l'anti-biais. L'anti-biais n'est pas activé. Les valeurs de boost négatives renverront donc une erreur. Les valeurs d'amélioration doivent être comprises entre 0 et 20. Toute valeur en dehors de cette plage renverra une erreur. Nous vous recommandons d'utiliser une approche de recherche binaire pour trouver la valeur optimale pour votre cas d'utilisation, ainsi que d'ajouter des expressions avec et sans boost à vos requêtes. |
État
Ensemble d'états qui définissent le cycle de vie d'un objet PhraseSet.
| Enums | |
|---|---|
STATE_UNSPECIFIED |
État non spécifié. Cette valeur n'est utilisée/utile que pour distinguer les valeurs non définies. |
ACTIVE |
État normal et actif. |
DELETED |
Cet ensemble de phrases a été supprimé. |
RecognitionConfig
Fournit à l'outil de reconnaissance des informations qui spécifient comment traiter la requête de reconnaissance.
| Champs | |
|---|---|
model |
Facultatif. Modèle à utiliser pour les requêtes de reconnaissance. Sélectionnez le modèle le mieux adapté à votre domaine pour obtenir de meilleurs résultats. Pour savoir quel modèle utiliser, consultez la documentation sur les modèles de transcription. Pour connaître les modèles compatibles dans chaque région, consultez le tableau des modèles compatibles. |
language_codes[] |
Facultatif. Langue de l'audio fourni en tant que tag de langue BCP-47. Les balises de langue sont normalisées au format BCP-47 avant d'être utilisées (par exemple, "en-us" devient "en-US"). Les langues acceptées pour chaque modèle sont listées dans le tableau des modèles acceptés. Si des langues supplémentaires sont fournies, le résultat de la reconnaissance contiendra la reconnaissance dans la langue la plus probable détectée. Le résultat de la reconnaissance inclura le tag de la langue détectée dans l'audio. |
features |
Fonctionnalités de reconnaissance vocale à activer. |
adaptation |
Contexte d'adaptation vocale qui pondère les prédictions du système de reconnaissance pour des mots et expressions spécifiques. |
transcript_normalization |
Facultatif. Utilisez la normalisation de la transcription pour remplacer automatiquement des parties de la transcription par les expressions de votre choix. Pour StreamingRecognize, cette normalisation ne s'applique qu'aux transcriptions partielles stables (stabilité > 0,8) et aux transcriptions finales. |
translation_config |
Facultatif. Configuration facultative utilisée pour exécuter automatiquement la traduction de l'audio donné dans la langue souhaitée pour les modèles compatibles. |
denoiser_config |
Facultatif. Configuration facultative de la suppression du bruit. Cette fonctionnalité n'est peut-être pas disponible pour tous les modèles et peut n'avoir aucun effet. |
Champ d'union decoding_config. Paramètres de décodage de l'audio envoyé pour reconnaissance. decoding_config ne peut être qu'un des éléments suivants : |
|
auto_decoding_config |
Détectez automatiquement les paramètres de décodage. Préféré pour les formats compatibles. |
explicit_decoding_config |
Paramètres de décodage spécifiés explicitement. Obligatoire si vous utilisez l'audio PCM sans en-tête (linear16, mulaw, alaw). |
RecognitionFeatures
Fonctionnalités de reconnaissance disponibles.
| Champs | |
|---|---|
profanity_filter |
Si le champ est défini sur |
enable_word_time_offsets |
Si la valeur est |
enable_word_confidence |
Si la valeur est |
enable_automatic_punctuation |
Si la valeur est définie sur |
enable_spoken_punctuation |
Comportement vis-à-vis de la ponctuation énoncée pour l'appel. Si la valeur est |
enable_spoken_emojis |
Comportement vis-à-vis des emoji énoncés pour l'appel. Si la valeur est |
multi_channel_mode |
Mode de reconnaissance de l'audio multicanal. |
diarization_config |
Configuration pour activer l'identification des locuteurs. Pour activer l'identification des locuteurs, définissez ce champ sur un message SpeakerDiarizationConfig vide. |
max_alternatives |
Nombre maximal d'hypothèses de reconnaissance à renvoyer. Le serveur peut renvoyer un nombre inférieur à |
MultiChannelMode
Options permettant de reconnaître l'audio multicanal.
| Enums | |
|---|---|
MULTI_CHANNEL_MODE_UNSPECIFIED |
Valeur par défaut pour le mode multicanal. Si l'audio contient plusieurs canaux, seul le premier sera transcrit. Les autres seront ignorés. |
SEPARATE_RECOGNITION_PER_CHANNEL |
Si cette option est sélectionnée, chaque canal de l'audio fourni est transcrit indépendamment. Cette option ne peut pas être sélectionnée si la valeur de model est latest_short. |
RecognitionOutputConfig
Options de configuration pour les sorties de reconnaissance.
| Champs | |
|---|---|
output_format_config |
Facultatif. Configuration du format des résultats stockés dans |
Champ d'union
|
|
gcs_output_config |
Si ce message s'affiche, les résultats de la reconnaissance sont écrits dans l'URI Google Cloud Storage fourni. |
inline_response_config |
Si ce message est renseigné, les résultats de la reconnaissance sont fournis dans le message |
RecognitionResponseMetadata
Métadonnées concernant la requête et la réponse de reconnaissance.
| Champs | |
|---|---|
request_id |
Identifiant de requête global généré automatiquement par l'API. |
total_billed_duration |
Le cas échéant, secondes audio facturées pour la requête correspondante. |
RecognizeRequest
Message de requête pour la méthode Recognize. Vous devez fournir la valeur content ou uri. Si vous n'en spécifiez aucune ou si vous spécifiez les deux, vous obtenez l'erreur INVALID_ARGUMENT. Consultez la section Limites relatives au contenu.
| Champs | |
|---|---|
recognizer |
Obligatoire. Nom de l'outil de reconnaissance à utiliser lors de la reconnaissance. Le format attendu est |
config |
Fonctionnalités et métadonnées audio à utiliser pour la reconnaissance vocale automatique. Ce champ, associé au champ |
config_mask |
Liste des champs de |
Champ d'union audio_source. Correspond à la source audio, qui se présente sous la forme de contenu intégré ou d'un URI Google Cloud Storage. audio_source ne peut être qu'un des éléments suivants : |
|
content |
Les octets de données audio sont encodés comme spécifié dans |
uri |
URI qui pointe vers un fichier contenant des octets de données audio, comme spécifié dans |
RecognizeResponse
Message de réponse pour la méthode Recognize.
| Champs | |
|---|---|
results[] |
Liste séquentielle des résultats de transcription correspondant à des parties séquentielles de l'audio. |
metadata |
Métadonnées sur la reconnaissance. |
Outil de reconnaissance
Message de l'outil de reconnaissance. Stocke la configuration et les métadonnées de reconnaissance.
| Champs | |
|---|---|
name |
Uniquement en sortie. Identifiant. Nom de ressource de l'outil de reconnaissance. Format : |
uid |
Uniquement en sortie. Identifiant unique attribué par le système au module de reconnaissance. |
display_name |
Nom lisible et défini par l'utilisateur pour l'outil de reconnaissance. L'ID ne doit pas contenir plus de 63 caractères |
model |
Facultatif. Ce champ est désormais obsolète. Préférez le champ Modèle à utiliser pour les requêtes de reconnaissance. Sélectionnez le modèle le mieux adapté à votre domaine pour obtenir de meilleurs résultats. Pour savoir quel modèle utiliser, consultez la documentation sur les modèles de transcription. Pour connaître les modèles compatibles dans chaque région, consultez le tableau des modèles compatibles. |
language_codes[] |
Facultatif. Ce champ est désormais obsolète. Préférez le champ Langue de l'audio fourni en tant que tag de langue BCP-47. Les langues acceptées pour chaque modèle sont listées dans le tableau des modèles acceptés. Si des langues supplémentaires sont fournies, le résultat de la reconnaissance contiendra la reconnaissance dans la langue la plus probable détectée. Le résultat de la reconnaissance inclura le tag de la langue détectée dans l'audio. Lorsque vous créez ou mettez à jour un Recognizer, ces valeurs sont stockées sous forme normalisée BCP-47. Par exemple, "en-us" est stocké sous la forme "en-US". |
default_recognition_config |
Configuration par défaut à utiliser pour les requêtes avec cet outil de reconnaissance. Cette valeur peut être remplacée par une configuration intégrée dans le champ |
annotations |
Permet aux utilisateurs de stocker de petites quantités de données arbitraires. La clé et la valeur ne doivent pas comporter plus de 63 caractères chacune. 100 annotations au maximum. |
state |
Uniquement en sortie. État du cycle de vie de l'outil de reconnaissance. |
create_time |
Uniquement en sortie. Heure de création. |
update_time |
Uniquement en sortie. Date et heure de la dernière modification de ce module de reconnaissance. |
delete_time |
Uniquement en sortie. Heure à laquelle la suppression de ce Recognizer a été demandée. |
expire_time |
Uniquement en sortie. Heure à laquelle cet outil de reconnaissance sera supprimé. |
etag |
Uniquement en sortie. Cette somme de contrôle est calculée par le serveur en fonction de la valeur des autres champs. Peut être envoyé lors des requêtes de mise à jour, de restauration et de suppression pour s'assurer que le client dispose d'une valeur à jour avant de continuer. |
reconciling |
Uniquement en sortie. Indique si cet outil de reconnaissance est en cours de mise à jour. |
kms_key_name |
Uniquement en sortie. Nom de la clé KMS avec laquelle le Recognizer est chiffré. Le format attendu est |
kms_key_version_name |
Uniquement en sortie. Nom de la version de clé KMS avec laquelle le Recognizer est chiffré. Le format attendu est |
État
Ensemble d'états qui définissent le cycle de vie d'un Recognizer.
| Enums | |
|---|---|
STATE_UNSPECIFIED |
Valeur par défaut. Cette valeur est utilisée si l'état est omis. |
ACTIVE |
Le module de reconnaissance est actif et prêt à être utilisé. |
DELETED |
Ce module de reconnaissance a été supprimé. |
SpeakerDiarizationConfig
Configuration pour activer l'identification des locuteurs.
| Champs | |
|---|---|
min_speaker_count |
Facultatif. Le système détermine automatiquement le nombre de locuteurs. Cette valeur n'est pas utilisée pour le moment. |
max_speaker_count |
Facultatif. Le système détermine automatiquement le nombre de locuteurs. Cette valeur n'est pas utilisée pour le moment. |
SpeechAdaptation
Fournit des "indices" à l'outil de reconnaissance vocale pour privilégier certains mots et expressions dans les résultats. Les PhraseSets peuvent être spécifiés en tant que ressource intégrée ou en tant que référence à une ressource PhraseSet existante.
| Champs | |
|---|---|
phrase_sets[] |
Liste de PhraseSets intégrés ou référencés. |
custom_classes[] |
Liste des CustomClasses intégrées. Les ressources CustomClass existantes peuvent être référencées directement dans un PhraseSet. |
AdaptationPhraseSet
Ensemble de phrases de biais, qui peut être une chaîne faisant référence au nom d'une ressource PhraseSets existante ou une définition intégrée d'un ensemble de phrases.
| Champs | |
|---|---|
Champ d'union
|
|
phrase_set |
Nom d'une ressource PhraseSet existante. L'utilisateur doit disposer d'un accès en lecture à la ressource, qui ne doit pas avoir été supprimée. |
inline_phrase_set |
Ensemble de phrases défini de manière intégrée. |
SpeechRecognitionAlternative
Hypothèses alternatives (liste des n meilleures)
| Champs | |
|---|---|
transcript |
Texte de transcription représentant les mots prononcés par l'utilisateur. |
confidence |
Estimation de fiabilité comprise entre 0,0 et 1,0. Un nombre élevé indique une plus grande probabilité estimée que les mots reconnus soient corrects. Ce champ n'est défini que pour la première alternative d'un résultat n'étant pas sous forme de flux, ou d'un résultat de flux dans lequel |
words[] |
Liste d'informations spécifiques au mot pour chaque mot reconnu. Lorsque |
SpeechRecognitionResult
Résultat de reconnaissance vocale correspondant à une partie des données audio.
| Champs | |
|---|---|
alternatives[] |
Peut contenir une ou plusieurs hypothèses de reconnaissance. Ces alternatives sont triées par précision, la première alternative étant la plus probable, par l'outil de reconnaissance. |
channel_tag |
Avec des données audio multicanaux, il s'agit du numéro de canal correspondant au résultat reconnu pour les données audio provenant de ce canal. Si |
result_end_offset |
Décalage temporel de la fin de ce résultat par rapport au début de l'audio. |
language_code |
Uniquement en sortie. Le tag de langue BCP-47 dans ce résultat. Ce code de langue a été détecté comme ayant le plus de chances d'être parlé dans l'audio. |
SrtOutputFileFormatConfig
Ce type ne comporte aucun champ.
Fichier de sous-titres au format SubRip Text.
StreamingRecognitionConfig
Fournit des informations de configuration pour la requête StreamingRecognize.
| Champs | |
|---|---|
config |
Obligatoire. Fonctionnalités et métadonnées audio à utiliser pour la reconnaissance vocale automatique. Ce champ, associé au champ |
config_mask |
Liste des champs de |
streaming_features |
Fonctionnalités de reconnaissance vocale permettant d'activer des requêtes de reconnaissance audio en streaming spécifiques |
StreamingRecognitionFeatures
Fonctionnalités de reconnaissance disponibles spécifiques aux requêtes de reconnaissance en streaming.
| Champs | |
|---|---|
enable_voice_activity_events |
Si la valeur est |
interim_results |
Indique s'il faut diffuser les résultats intermédiaires au client. Si la valeur est "true", les résultats intermédiaires seront diffusés au client. Sinon, seule la réponse finale sera renvoyée en flux continu. |
voice_activity_timeout |
Si cette valeur est définie, le serveur ferme automatiquement le flux une fois la durée spécifiée écoulée après l'envoi du dernier événement vocal VOICE_ACTIVITY. Le champ |
VoiceActivityTimeout
Événements pour lesquels un délai avant expiration peut être défini pour l'activité Voice.
| Champs | |
|---|---|
speech_start_timeout |
Durée avant expiration du flux si aucune activité vocale ne commence. Si cette valeur est définie et qu'aucune parole n'est détectée pendant cette durée au début du flux, le serveur ferme le flux. |
speech_end_timeout |
Durée d'expiration du flux après la fin de la parole. Si cette valeur est définie et qu'aucune parole n'est détectée pendant cette durée après la détection d'une parole, le serveur ferme le flux. |
StreamingRecognitionResult
Résultat de reconnaissance vocale correspondant à une partie des données audio en cours de traitement.
| Champs | |
|---|---|
alternatives[] |
Peut contenir une ou plusieurs hypothèses de reconnaissance. Ces alternatives sont triées par précision, la première alternative étant la plus probable, par l'outil de reconnaissance. |
is_final |
Si le champ est défini sur |
stability |
Une estimation de la probabilité que l'outil de reconnaissance ne modifie pas sa supposition relative au résultat provisoire. Les valeurs s'étendent de 0,0 (complètement instable) à 1,0 (complètement stable). Ce champ n'est fourni que pour les résultats provisoires ( |
result_end_offset |
Décalage temporel de la fin de ce résultat par rapport au début de l'audio. |
channel_tag |
Avec des données audio multicanaux, il s'agit du numéro de canal correspondant au résultat reconnu pour les données audio provenant de ce canal. Si |
language_code |
Uniquement en sortie. Le tag de langue BCP-47 dans ce résultat. Ce code de langue a été détecté comme ayant le plus de chances d'être parlé dans l'audio. |
StreamingRecognizeRequest
Message de requête pour la méthode StreamingRecognize. Plusieurs messages StreamingRecognizeRequest sont envoyés en un seul appel.
Si le Recognizer référencé par recognizer contient une configuration de requête entièrement spécifiée, le flux ne peut contenir que des messages avec audio défini.
Sinon, le premier message doit contenir un message recognizer et un message streaming_config qui, ensemble, spécifient entièrement la configuration de la requête et ne doivent pas contenir de audio. Tous les messages suivants ne doivent contenir que audio.
| Champs | |
|---|---|
recognizer |
Obligatoire. Nom de l'outil de reconnaissance à utiliser lors de la reconnaissance. Le format attendu est |
Champ d'union
|
|
streaming_config |
StreamingRecognitionConfig à utiliser pour cette tentative de reconnaissance. Si elle est fournie, elle remplace la RecognitionConfig par défaut stockée dans l'outil de reconnaissance. |
audio |
Octets audio intégrés à reconnaître. La taille maximale de ce champ est de 15 Ko par requête. |
StreamingRecognizeResponse
StreamingRecognizeResponse est le seul message renvoyé au client par StreamingRecognize. Une série de zéro messages StreamingRecognizeResponse ou plus est renvoyée au client. S'il n'y a pas d'audio reconnaissable, aucun message n'est retransmis au client.
Voici quelques exemples de StreamingRecognizeResponse pouvant être renvoyées lors du traitement du contenu audio :
results { alternatives { transcript: "tube" } stability: 0.01 }
results { alternatives { transcript: "to be a" } stability: 0.01 }
results { alternatives { transcript: "to be" } stability: 0.9 } results { alternatives { transcript: " or not to be" } stability: 0.01 }
results { alternatives { transcript: "to be or not to be" confidence: 0.92 } alternatives { transcript: "to bee or not to bee" } is_final: true }
results { alternatives { transcript: " that's" } stability: 0.01 }
results { alternatives { transcript: " that is" } stability: 0.9 } results { alternatives { transcript: " the question" } stability: 0.01 }
results { alternatives { transcript: " that is the question" confidence: 0.98 } alternatives { transcript: " that was the question" } is_final: true }
Remarques :
Parmi les réponses ci-dessus, seules les lignes 4 et 7 contiennent des résultats finaux, indiqués par
is_final: true. En combinant ces réponses, nous obtenons l'intégralité de la transcription : "to be or not to be that is the question" ("être ou ne pas être, telle est la question").Les autres contiennent des
resultsintermédiaires. Les réponses n° 3 et 6 contiennent deuxresultsintermédiaires : la première partie présente une grande stabilité et est moins susceptible de changer. La deuxième partie présente une faible stabilité et est très susceptible de changer. Les concepteurs d'interface utilisateur peuvent choisir de n'afficher que des champsresultsde stabilité élevée.Les valeurs
stabilityetconfidencespécifiques indiquées ci-dessus ne sont données qu'à titre d'exemple. Les valeurs réelles peuvent varier.Dans chaque réponse, un seul de ces champs sera défini :
error,speech_event_typeou un ou plusieursresults(répétés).
| Champs | |
|---|---|
results[] |
Cette liste répétée contient zéro résultats ou plus, correspondant à des parties consécutives de l'audio en cours de traitement. Elle contient zéro ou un résultat |
speech_event_type |
Indique le type d'événement de discours. |
speech_event_offset |
Décalage temporel entre le début de l'audio et l'émission d'un événement. |
metadata |
Métadonnées sur la reconnaissance. |
SpeechEventType
Indique le type d'événement de discours.
| Énumérations (Enums) | |
|---|---|
SPEECH_EVENT_TYPE_UNSPECIFIED |
Aucun événement de discours spécifié. |
END_OF_SINGLE_UTTERANCE |
Cet événement indique que le serveur a détecté la fin de l'énoncé de l'utilisateur et ne s'attend plus à aucune entrée vocale. Le serveur ne traite donc pas de nouvelles données audio et ferme le flux bidirectionnel gRPC. Cet événement n'est envoyé que si la diffusion a été interrompue de force en raison d'un silence détecté plus tôt que prévu. Cet événement n'est disponible que sur latest_short model. |
SPEECH_ACTIVITY_BEGIN |
Cet événement indique que le serveur a détecté le début d'une activité vocale humaine dans le flux. Cet événement peut être renvoyé plusieurs fois si la parole commence et s'arrête à plusieurs reprises tout au long du flux. Cet événement n'est envoyé que si voice_activity_events est défini sur "true". |
SPEECH_ACTIVITY_END |
Cet événement indique que le serveur a détecté la fin de l'activité vocale humaine dans le flux. Cet événement peut être renvoyé plusieurs fois si la parole commence et s'arrête à plusieurs reprises tout au long du flux. Cet événement n'est envoyé que si voice_activity_events est défini sur "true". |
TranscriptNormalization
Configuration de la normalisation de la transcription. Utilisez la normalisation de la transcription pour remplacer automatiquement des parties de la transcription par les expressions de votre choix. Pour StreamingRecognize, cette normalisation ne s'applique qu'aux transcriptions partielles stables (stabilité > 0,8) et aux transcriptions finales.
| Champs | |
|---|---|
entries[] |
Liste des entrées de remplacement. Nous effectuerons le remplacement d'une entrée à la fois. Par exemple, la deuxième entrée de ["cat" => "dog", "mountain cat" => "mountain dog"] ne sera jamais appliquée, car nous traiterons toujours la première entrée avant. 100 entrées au maximum. |
Entrée
Configuration de remplacement unique.
| Champs | |
|---|---|
search |
Ce que vous souhaitez remplacer. La longueur maximale est de 100 caractères. |
replace |
Par quoi remplacer le texte. La longueur maximale est de 100 caractères. |
case_sensitive |
Indique si la recherche est sensible à la casse. |
TranslationConfig
Configuration de la traduction. Utilisez-le pour traduire le contenu audio donné en texte dans la langue souhaitée.
| Champs | |
|---|---|
target_language |
Obligatoire. Code de langue dans laquelle traduire. |
UndeleteCustomClassRequest
Message de requête pour la méthode UndeleteCustomClass.
| Champs | |
|---|---|
name |
Obligatoire. Nom de la CustomClass dont vous souhaitez annuler la suppression. Format : |
validate_only |
Si ce champ est défini, validez la requête et prévisualisez la CustomClass dont la suppression a été annulée, mais n'annulez pas sa suppression. |
etag |
Cette somme de contrôle est calculée par le serveur en fonction de la valeur des autres champs. Peut être envoyé lors des requêtes de mise à jour, de restauration et de suppression pour s'assurer que le client dispose d'une valeur à jour avant de continuer. |
UndeletePhraseSetRequest
Message de requête pour la méthode UndeletePhraseSet.
| Champs | |
|---|---|
name |
Obligatoire. Nom de l'ensemble de phrases dont vous souhaitez annuler la suppression. Format : |
validate_only |
Si ce champ est défini, validez la requête et prévisualisez l'ensemble de phrases restauré, mais n'annulez pas sa suppression. |
etag |
Cette somme de contrôle est calculée par le serveur en fonction de la valeur des autres champs. Peut être envoyé lors des requêtes de mise à jour, de restauration et de suppression pour s'assurer que le client dispose d'une valeur à jour avant de continuer. |
UndeleteRecognizerRequest
Message de requête pour la méthode UndeleteRecognizer.
| Champs | |
|---|---|
name |
Obligatoire. Nom de l'outil de reconnaissance dont vous souhaitez annuler la suppression. Format : |
validate_only |
Si ce champ est défini, validez la requête et prévisualisez l'outil de reconnaissance restauré, mais n'annulez pas sa suppression. |
etag |
Cette somme de contrôle est calculée par le serveur en fonction de la valeur des autres champs. Peut être envoyé lors des requêtes de mise à jour, de restauration et de suppression pour s'assurer que le client dispose d'une valeur à jour avant de continuer. |
UpdateConfigRequest
Message de requête pour la méthode UpdateConfig.
| Champs | |
|---|---|
config |
Obligatoire. Configuration à mettre à jour. Le champ |
update_mask |
Liste des champs à mettre à jour. |
UpdateCustomClassRequest
Message de requête pour la méthode UpdateCustomClass.
| Champs | |
|---|---|
custom_class |
Obligatoire. La CustomClass à mettre à jour. Le champ |
update_mask |
Liste des champs à mettre à jour. Si ce paramètre est vide, tous les champs sont pris en compte pour la mise à jour. |
validate_only |
Si ce champ est défini, vous validez la requête et prévisualisez la CustomClass mise à jour, mais ne la mettez pas à jour réellement. |
UpdatePhraseSetRequest
Message de requête pour la méthode UpdatePhraseSet.
| Champs | |
|---|---|
phrase_set |
Obligatoire. Ensemble de phrases à mettre à jour. Le champ |
update_mask |
Liste des champs à mettre à jour. Si ce champ est vide, tous les champs dont la valeur n'est pas celle par défaut sont considérés comme devant être mis à jour. Utilisez |
validate_only |
Si ce champ est défini, validez la requête et prévisualisez l'ensemble de phrases mis à jour, mais ne le mettez pas à jour réellement. |
UpdateRecognizerRequest
Message de requête pour la méthode UpdateRecognizer.
| Champs | |
|---|---|
recognizer |
Obligatoire. Outil de reconnaissance à mettre à jour. Le champ |
update_mask |
Liste des champs à mettre à jour. Si ce champ est vide, tous les champs dont la valeur n'est pas celle par défaut sont considérés comme devant être mis à jour. Utilisez |
validate_only |
Si ce champ est défini, validez la requête et prévisualisez l'outil de reconnaissance mis à jour, mais ne le mettez pas à jour réellement. |
VttOutputFileFormatConfig
Ce type ne comporte aucun champ.
Configurations de sortie pour le fichier de sous-titres au format WebVTT.
WordInfo
Informations spécifiques au mot pour les mots reconnus.
| Champs | |
|---|---|
start_offset |
Décalage temporel relatif au début des données audio et correspondant au début du mot prononcé. Ce champ n'est défini que si |
end_offset |
Décalage temporel relatif au début des données audio et correspondant à la fin du mot prononcé. Ce champ n'est défini que si |
word |
Mot correspondant à cet ensemble d'informations. |
confidence |
Estimation de fiabilité comprise entre 0,0 et 1,0. Un nombre élevé indique une plus grande probabilité estimée que les mots reconnus soient corrects. Ce champ n'est défini que pour la première alternative d'un résultat n'étant pas sous forme de flux, ou d'un résultat de flux dans lequel |
speaker_label |
Un libellé distinct est attribué à chaque locuteur dans l'audio. Ce champ spécifie lequel de ces locuteurs a été détecté pour avoir prononcé ce mot. |