Index
Speech(Benutzeroberfläche)AccessMetadata(Meldung)AccessMetadata.ConstraintType(Aufzählung)AutoDetectDecodingConfig(Meldung)BatchRecognizeFileMetadata(Meldung)BatchRecognizeFileResult(Meldung)BatchRecognizeMetadata(Meldung)BatchRecognizeRequest(Meldung)BatchRecognizeRequest.ProcessingStrategy(Aufzählung)BatchRecognizeResponse(Meldung)BatchRecognizeResults(Meldung)BatchRecognizeTranscriptionMetadata(Meldung)CloudStorageResult(Meldung)Config(Meldung)CreateCustomClassRequest(Meldung)CreatePhraseSetRequest(Meldung)CreateRecognizerRequest(Meldung)CustomClass(Meldung)CustomClass.ClassItem(Meldung)CustomClass.State(Aufzählung)DeleteCustomClassRequest(Meldung)DeletePhraseSetRequest(Meldung)DeleteRecognizerRequest(Meldung)DenoiserConfig(Meldung)ExplicitDecodingConfig(Meldung)ExplicitDecodingConfig.AudioEncoding(Aufzählung)GcsOutputConfig(Meldung)GetConfigRequest(Meldung)GetCustomClassRequest(Meldung)GetPhraseSetRequest(Meldung)GetRecognizerRequest(Meldung)InlineOutputConfig(Meldung)InlineResult(Meldung)LanguageMetadata(Meldung)ListCustomClassesRequest(Meldung)ListCustomClassesResponse(Meldung)ListPhraseSetsRequest(Meldung)ListPhraseSetsResponse(Meldung)ListRecognizersRequest(Meldung)ListRecognizersResponse(Meldung)LocationsMetadata(Meldung)ModelFeature(Meldung)ModelFeatures(Meldung)ModelMetadata(Meldung)NativeOutputFileFormatConfig(Meldung)OperationMetadata(Meldung)OutputFormatConfig(Meldung)PhraseSet(Meldung)PhraseSet.Phrase(Meldung)PhraseSet.State(Aufzählung)RecognitionConfig(Meldung)RecognitionFeatures(Meldung)RecognitionFeatures.MultiChannelMode(Aufzählung)RecognitionOutputConfig(Meldung)RecognitionResponseMetadata(Meldung)RecognizeRequest(Meldung)RecognizeResponse(Meldung)Recognizer(Meldung)Recognizer.State(Aufzählung)SpeakerDiarizationConfig(Meldung)SpeechAdaptation(Meldung)SpeechAdaptation.AdaptationPhraseSet(Meldung)SpeechRecognitionAlternative(Meldung)SpeechRecognitionResult(Meldung)SrtOutputFileFormatConfig(Meldung)StreamingRecognitionConfig(Meldung)StreamingRecognitionFeatures(Meldung)StreamingRecognitionFeatures.VoiceActivityTimeout(Meldung)StreamingRecognitionResult(Meldung)StreamingRecognizeRequest(Meldung)StreamingRecognizeResponse(Meldung)StreamingRecognizeResponse.SpeechEventType(Aufzählung)TranscriptNormalization(Meldung)TranscriptNormalization.Entry(Meldung)TranslationConfig(Meldung)UndeleteCustomClassRequest(Meldung)UndeletePhraseSetRequest(Meldung)UndeleteRecognizerRequest(Meldung)UpdateConfigRequest(Meldung)UpdateCustomClassRequest(Meldung)UpdatePhraseSetRequest(Meldung)UpdateRecognizerRequest(Meldung)VttOutputFileFormatConfig(Meldung)WordInfo(Meldung)
Speech
Ermöglicht die Sprachtranskription und Ressourcenverwaltung.
| BatchRecognize |
|---|
|
Führt die asynchrone Batch-Spracherkennung durch: Sie senden eine Anfrage mit N Audiodateien und erhalten einen Vorgang, der lange dauert und per Polling abgefragt werden kann, um festzustellen, wann die Transkriptionen abgeschlossen sind.
|
| CreateCustomClass |
|---|
|
Erstellt einen
|
| CreatePhraseSet |
|---|
|
Erstellt einen
|
| CreateRecognizer |
|---|
|
Erstellt einen
|
| DeleteCustomClass |
|---|
|
Löscht die
|
| DeletePhraseSet |
|---|
|
Löscht die
|
| DeleteRecognizer |
|---|
|
Löscht die
|
| GetConfig |
|---|
|
Gibt die angeforderte
|
| GetCustomClass |
|---|
|
Gibt die angeforderte
|
| GetPhraseSet |
|---|
|
Gibt die angeforderte
|
| GetRecognizer |
|---|
|
Gibt die angeforderte
|
| ListCustomClasses |
|---|
|
Listet CustomClasses auf.
|
| ListPhraseSets |
|---|
|
Listet PhraseSets auf.
|
| ListRecognizers |
|---|
|
Listet Erkennungssysteme auf.
|
| Erkennen |
|---|
|
Führt synchrone Spracherkennung durch: Die Ergebnisse erhalten Sie, wenn alle Audiodaten gesendet und verarbeitet wurden.
|
| StreamingRecognize |
|---|
|
Führt bidirektionale Streamingspracherkennung durch: Die Ergebnisse erhalten Sie, während die Audiodaten gesendet werden. Diese Methode ist nur über die gRPC API (nicht über die REST API) verfügbar.
|
| UndeleteCustomClass |
|---|
|
Macht das Löschen von
|
| UndeletePhraseSet |
|---|
|
Macht das Löschen von
|
| UndeleteRecognizer |
|---|
|
Macht das Löschen von
|
| UpdateConfig |
|---|
|
Aktualisiert den
|
| UpdateCustomClass |
|---|
|
Aktualisiert den
|
| UpdatePhraseSet |
|---|
|
Aktualisiert den
|
| UpdateRecognizer |
|---|
|
Aktualisiert den
|
AccessMetadata
Die Zugriffsmetadaten für eine bestimmte Region. Dies kann angewendet werden, wenn die Organisationsrichtlinie für das jeweilige Projekt eine bestimmte Region nicht zulässt.
| Felder | |
|---|---|
constraint_type |
Beschreibt die verschiedenen Arten von Einschränkungen, die angewendet werden. |
ConstraintType
Beschreibt die verschiedenen Arten von Einschränkungen, die auf eine Region angewendet werden können.
| Enums | |
|---|---|
CONSTRAINT_TYPE_UNSPECIFIED |
Nicht angegebene Einschränkung angewendet. |
RESOURCE_LOCATIONS_ORG_POLICY_CREATE_CONSTRAINT |
Die Organisationsrichtlinie des Projekts lässt die angegebene Region nicht zu. |
AutoDetectDecodingConfig
Dieser Typ hat keine Felder.
Automatisch erkannte Decodierungsparameter. Unterstützt für die folgenden Codierungen:
WAV_LINEAR16: 16-Bit-Little-Endian-PCM-Samples mit Vorzeichen in einem WAV-Container.
WAV_MULAW: 8-Bit-kompandierte Mulaw-Samples in einem WAV-Container.
WAV_ALAW: 8-Bit-kompandierte A-Law-Samples in einem WAV-Container.
RFC4867_5_AMR: AMR-Frames mit einem rfc4867.5-Header.
RFC4867_5_AMRWB: AMR-WB-Frames mit einem rfc4867.5-Header.
FLAC: FLAC-Frames im Containerformat „Natives FLAC“.
MP3: MPEG-Audio-Frames mit optionalen (ignorierten) ID3-Metadaten.
OGG_OPUS: Opus-Audioframes in einem Ogg-Container.
WEBM_OPUS: Opus-Audioframes in einem WebM-Container.
MP4_AAC: AAC-Audioframes in einem MP4-Container.
M4A_AAC: AAC-Audioframes in einem M4A-Container.
MOV_AAC: AAC-Audioframes in einem MOV-Container.
BatchRecognizeFileMetadata
Metadaten zu einer einzelnen Datei in einem Batch für BatchRecognize.
| Felder | |
|---|---|
config |
Funktionen und Audiometadaten, die für die automatische Spracherkennung verwendet werden sollen. Dieses Feld kann in Kombination mit dem Feld |
config_mask |
Die Liste der Felder in |
Union-Feld audio_source. Die Audioquelle, bei der es sich um einen Google Cloud Storage-URI handelt. Für audio_source ist nur einer der folgenden Werte zulässig: |
|
uri |
Cloud Storage-URI für die Audiodatei. |
BatchRecognizeFileResult
Die endgültigen Ergebnisse für eine einzelne Datei.
| Felder | |
|---|---|
error |
Fehler, falls einer aufgetreten ist. |
metadata |
|
uri |
Verworfen. Verwenden Sie stattdessen |
transcript |
Verworfen. Verwenden Sie stattdessen |
Union-Feld Für |
|
cloud_storage_result |
Erkennungsergebnisse werden in Cloud Storage geschrieben. Wird nur ausgefüllt, wenn |
inline_result |
Erkennungsergebnisse Wird nur ausgefüllt, wenn |
BatchRecognizeMetadata
Vorgangsmetadaten für BatchRecognize.
| Felder | |
|---|---|
transcription_metadata |
Ordnen Sie den bereitgestellten Dateinamen den Transkriptionsmetadaten für diese Datei zu. |
BatchRecognizeRequest
Anfragenachricht für die Methode BatchRecognize.
| Felder | |
|---|---|
recognizer |
Erforderlich. Der Name des Recognizer, der während der Erkennung verwendet werden soll. Das erwartete Format ist |
config |
Funktionen und Audiometadaten, die für die automatische Spracherkennung verwendet werden sollen. Mit diesem Feld in Kombination mit dem Feld |
config_mask |
Die Liste der Felder in |
files[] |
Audiodateien mit Dateimetadaten für die automatische Spracherkennung. Es dürfen maximal 15 Dateien angegeben werden. |
recognition_output_config |
Konfigurationsoptionen für den Speicherort der Transkripte der einzelnen Dateien. |
processing_strategy |
Die für diese Anfrage zu verwendende Verarbeitungsstrategie. |
ProcessingStrategy
Mögliche Verarbeitungsstrategien für Batchanfragen.
| Enums | |
|---|---|
PROCESSING_STRATEGY_UNSPECIFIED |
Standardwert für die Verarbeitungsstrategie. Die Anfrage wird sofort nach Eingang bearbeitet. |
DYNAMIC_BATCHING |
Wenn diese Option ausgewählt ist, wird die Anfrage in Zeiten geringerer Auslastung verarbeitet, um einen Preisnachlass zu erhalten. Die Anfrage wird innerhalb von 24 Stunden bearbeitet. |
BatchRecognizeResponse
Antwortnachricht für BatchRecognize, die in einem Vorgang mit langer Laufzeit Operation verpackt ist.
| Felder | |
|---|---|
results |
Ordnet den Dateinamen dem Endergebnis für diese Datei zu. |
total_billed_duration |
Wenn verfügbar, die abgerechneten Audiosekunden für die entsprechende Anfrage. |
BatchRecognizeResults
Ausgabetyp für Cloud Storage von BatchRecognize-Transkripten. Dieses Proto wird zwar nirgends in dieser API zurückgegeben, die Cloud Storage-Transkripte werden jedoch als serialisiertes Proto zurückgegeben und sollten entsprechend geparst werden.
| Felder | |
|---|---|
results[] |
Sequenzielle Liste der Transkriptionsergebnisse, die den sequenziellen Teilen einer Audiodatei entsprechen. |
metadata |
Metadaten zur Erkennung. |
BatchRecognizeTranscriptionMetadata
Metadaten zur Transkription für eine einzelne Datei, z. B. der Fortschritt in Prozent.
| Felder | |
|---|---|
progress_percent |
Wie viel von der Datei bisher transkribiert wurde. |
error |
Fehler, falls einer aufgetreten ist. |
uri |
Der Cloud Storage-URI, in den die Erkennungsergebnisse geschrieben werden. |
CloudStorageResult
Die Endergebnisse werden in Cloud Storage geschrieben.
| Felder | |
|---|---|
uri |
Der Cloud Storage-URI, in den die Erkennungsergebnisse geschrieben wurden. |
vtt_format_uri |
Der Cloud Storage-URI, in den die Erkennungsergebnisse als VTT-formatierte Untertitel geschrieben wurden. Dieses Feld wird nur ausgefüllt, wenn die |
srt_format_uri |
Der Cloud Storage-URI, in den die Erkennungsergebnisse als SRT-formatierte Untertitel geschrieben wurden. Dieses Feld wird nur ausgefüllt, wenn die |
Konfiguration
Nachricht, die die Konfiguration für die Speech-to-Text API darstellt. Dazu gehört ein optionaler KMS-Schlüssel, mit dem eingehende Daten verschlüsselt werden.
| Felder | |
|---|---|
name |
Nur Ausgabe. ID. Der Name der Konfigurationsressource. Es gibt genau eine Konfigurationsressource pro Projekt und Standort. Das erwartete Format ist |
kms_key_name |
Optional. Ein optionaler KMS-Schlüsselname, der, falls vorhanden, zum Verschlüsseln von Speech-to-Text-Ressourcen im Ruhezustand verwendet wird. Wenn Sie diesen Schlüssel aktualisieren, werden vorhandene Ressourcen nicht mit diesem Schlüssel verschlüsselt. Nur neue Ressourcen werden mit diesem Schlüssel verschlüsselt. Das erwartete Format ist |
update_time |
Nur Ausgabe. Der Zeitpunkt der letzten Änderung an dieser Ressource. |
CreateCustomClassRequest
Anfragenachricht für die Methode CreateCustomClass.
| Felder | |
|---|---|
custom_class |
Erforderlich. Die zu erstellende CustomClass. |
validate_only |
Wenn festgelegt, wird die Anfrage validiert und eine Vorschau der CustomClass angezeigt, sie wird aber nicht erstellt. |
custom_class_id |
Die für die CustomClass zu verwendende ID, die als letzte Komponente des Ressourcennamens der CustomClass verwendet wird. Dieser Wert sollte 4 bis 63 Zeichen umfassen. Gültige Zeichen sind /[az][0-9]-/. |
parent |
Erforderlich. Das Projekt und der Standort, an dem diese CustomClass erstellt wird. Das erwartete Format ist |
CreatePhraseSetRequest
Anfragenachricht für die Methode CreatePhraseSet.
| Felder | |
|---|---|
phrase_set |
Erforderlich. Das zu erstellende PhraseSet. |
validate_only |
Wenn festgelegt, wird die Anfrage validiert und eine Vorschau des PhraseSets angezeigt, es wird aber nicht erstellt. |
phrase_set_id |
Die für das PhraseSet zu verwendende ID, die als letzte Komponente des Ressourcennamens des PhraseSets verwendet wird. Dieser Wert sollte 4 bis 63 Zeichen umfassen. Gültige Zeichen sind /[az][0-9]-/. |
parent |
Erforderlich. Das Projekt und der Standort, an dem dieses PhraseSet erstellt wird. Das erwartete Format ist |
CreateRecognizerRequest
Anfragenachricht für die Methode CreateRecognizer.
| Felder | |
|---|---|
recognizer |
Erforderlich. Der zu erstellende Recognizer. |
validate_only |
Wenn festgelegt, wird die Anfrage validiert und eine Vorschau der Erkennung angezeigt, sie wird aber nicht erstellt. |
recognizer_id |
Die für den Recognizer zu verwendende ID, die die letzte Komponente des Ressourcennamens des Recognizers darstellt. Dieser Wert sollte 4 bis 63 Zeichen umfassen. Gültige Zeichen sind /[az][0-9]-/. |
parent |
Erforderlich. Das Projekt und der Standort, an dem dieser Recognizer erstellt wird. Das erwartete Format ist |
CustomClass
CustomClass für die Gewichtung bei der Spracherkennung. Damit definieren Sie eine Reihe von Wörtern oder Begriffen, die ein gemeinsames Konzept oder Thema darstellen, das wahrscheinlich in Ihrem Audio vorkommt, z. B. eine Liste von Namen von Passagierschiffen.
| Felder | |
|---|---|
name |
Nur Ausgabe. ID. Der Ressourcenname der CustomClass. Format: |
uid |
Nur Ausgabe. Vom System zugewiesene eindeutige Kennung für die CustomClass. |
display_name |
Optional. Vom Nutzer festlegbarer, für Menschen lesbarer Name für die CustomClass. Darf höchstens 63 Zeichen lang sein. |
items[] |
Eine Sammlung von Klassenelementen. |
state |
Nur Ausgabe. Der Lebenszyklusstatus der CustomClass. |
create_time |
Nur Ausgabe. Erstellungszeit. |
update_time |
Nur Ausgabe. Der Zeitpunkt der letzten Änderung an dieser Ressource. |
delete_time |
Nur Ausgabe. Der Zeitpunkt, zu dem das Löschen dieser Ressource angefordert wurde. |
expire_time |
Nur Ausgabe. Der Zeitpunkt, zu dem diese Ressource gelöscht wird. |
annotations |
Optional. Ermöglicht Nutzern das Speichern kleiner Mengen beliebiger Daten. Sowohl der Schlüssel als auch der Wert dürfen jeweils maximal 63 Zeichen lang sein. Maximal 100 Annotationen. |
etag |
Nur Ausgabe. Diese Prüfsumme wird vom Server auf Grundlage des Werts anderer Felder berechnet. Kann bei Aktualisierungs-, Wiederherstellungs- und Löschanfragen gesendet werden, um sicherzustellen, dass der Client vor dem Fortfahren einen aktuellen Wert hat. |
reconciling |
Nur Ausgabe. Gibt an, ob diese CustomClass gerade aktualisiert wird. |
kms_key_name |
Nur Ausgabe. Der KMS-Schlüsselname, mit dem die CustomClass verschlüsselt wird. Das erwartete Format ist |
kms_key_version_name |
Nur Ausgabe. Der Name der KMS-Schlüsselversion, mit der die CustomClass verschlüsselt wird. Das erwartete Format ist |
ClassItem
Ein Element der Klasse.
| Felder | |
|---|---|
value |
Der Wert des Klassenartikels. |
Bundesland
Eine Reihe von Status, die den Lebenszyklus einer CustomClass definieren.
| Enums | |
|---|---|
STATE_UNSPECIFIED |
Nicht angegebener Zustand. Dies wird nur verwendet, um nicht festgelegte Werte zu unterscheiden. |
ACTIVE |
Der normale und der aktive Status. |
DELETED |
Diese CustomClass wurde gelöscht. |
DeleteCustomClassRequest
Anfragenachricht für die Methode DeleteCustomClass.
| Felder | |
|---|---|
name |
Erforderlich. Der Name der zu löschenden CustomClass. Format: |
validate_only |
Wenn festgelegt, wird die Anfrage validiert und eine Vorschau der gelöschten CustomClass angezeigt, sie wird aber nicht tatsächlich gelöscht. |
allow_missing |
Wenn dieser Wert auf „true“ gesetzt ist und die CustomClass nicht gefunden wird, ist die Anfrage erfolgreich und es wird keine Operation aufgezeichnet. |
etag |
Diese Prüfsumme wird vom Server auf Grundlage des Werts anderer Felder berechnet. Kann bei Aktualisierungs-, Wiederherstellungs- und Löschanfragen gesendet werden, um sicherzustellen, dass der Client vor dem Fortfahren einen aktuellen Wert hat. |
DeletePhraseSetRequest
Anfragenachricht für die Methode DeletePhraseSet.
| Felder | |
|---|---|
name |
Erforderlich. Der Name des zu löschenden PhraseSets. Format: |
validate_only |
Wenn festgelegt, wird die Anfrage validiert und eine Vorschau des gelöschten PhraseSet angezeigt, es wird aber nicht tatsächlich gelöscht. |
allow_missing |
Wenn dieser Wert auf „true“ gesetzt ist und das PhraseSet nicht gefunden wird, ist die Anfrage erfolgreich und es wird nichts ausgeführt (in diesem Fall wird kein Vorgang aufgezeichnet). |
etag |
Diese Prüfsumme wird vom Server auf Grundlage des Werts anderer Felder berechnet. Kann bei Aktualisierungs-, Wiederherstellungs- und Löschanfragen gesendet werden, um sicherzustellen, dass der Client vor dem Fortfahren einen aktuellen Wert hat. |
DeleteRecognizerRequest
Anfragenachricht für die Methode DeleteRecognizer.
| Felder | |
|---|---|
name |
Erforderlich. Der Name des zu löschenden Recognizers. Format: |
validate_only |
Wenn festgelegt, wird die Anfrage validiert und eine Vorschau des gelöschten Recognizers angezeigt, er wird aber nicht tatsächlich gelöscht. |
allow_missing |
Wenn dieser Wert auf „true“ gesetzt ist und die Erkennung nicht gefunden wird, ist die Anfrage erfolgreich und es wird keine Aktion ausgeführt (in diesem Fall wird kein Vorgang aufgezeichnet). |
etag |
Diese Prüfsumme wird vom Server auf Grundlage des Werts anderer Felder berechnet. Kann bei Aktualisierungs-, Wiederherstellungs- und Löschanfragen gesendet werden, um sicherzustellen, dass der Client vor dem Fortfahren einen aktuellen Wert hat. |
DenoiserConfig
Konfiguration der Rauschunterdrückung. Wird möglicherweise nicht für alle Modelle unterstützt und hat möglicherweise keine Auswirkungen.
| Felder | |
|---|---|
denoise_audio |
Entfernt Rauschen aus der Audioeingabe, bevor sie an das Transkriptionsmodell gesendet wird. |
snr_threshold |
SNR-Grenzwert (Signal-to-Noise Ratio) für den Denoiser. Hier steht SNR für die Lautstärke des Sprachsignals. Audio mit einem SNR unter diesem Grenzwert, d. h. Sprache, die zu leise ist, wird nicht an das Transkriptionsmodell gesendet. Wenn snr_threshold=0, wird keine Filterung angewendet. |
ExplicitDecodingConfig
Explizit angegebene Decodierungsparameter.
| Felder | |
|---|---|
encoding |
Erforderlich. Codierung der Audiodaten, die zur Erkennung gesendet werden. |
sample_rate_hertz |
Optional. Abtastrate der zur Spracherkennung gesendeten Audiodaten in Hertz. Gültige Werte sind: 8.000–48.000. Der optimale Wert ist 16.000. Stellen Sie die Abtastrate der Audioquelle auf 16.000 Hz ein, um die besten Ergebnisse zu erzielen. Falls dies nicht möglich ist, verwenden Sie die native Abtastrate der Audioquelle (anstatt eine erneute Abtastung durchzuführen). Dieses Feld ist aus Gründen der Abwärtskompatibilität als OPTIONAL gekennzeichnet. Sie ist (und war schon immer) praktisch ERFORDERLICH. |
audio_channel_count |
Optional. Anzahl der Kanäle in den zur Spracherkennung gesendeten Audiodaten. Dieses Feld ist aus Gründen der Abwärtskompatibilität als OPTIONAL gekennzeichnet. Sie ist (und war schon immer) praktisch ERFORDERLICH. Der maximal zulässige Wert beträgt 8. |
AudioEncoding
Unterstützte Codierungen von Audiodaten.
| Enums | |
|---|---|
AUDIO_ENCODING_UNSPECIFIED |
Standardwert Dieser Wert wird nicht verwendet. |
LINEAR16 |
16-Bit-Little-Endian-PCM-Samples mit Vorzeichen ohne Header. |
MULAW |
Headerlose 8-Bit-Samples mit kompandiertem Mulaw. |
ALAW |
Headerlose 8-Bit-kompandierte A-Law-Samples. |
AMR |
AMR-Frames mit einem rfc4867.5-Header. |
AMR_WB |
AMR-WB-Frames mit einem rfc4867.5-Header. |
FLAC |
FLAC-Frames im Containerformat „Native FLAC“. |
MP3 |
MPEG-Audio-Frames mit optionalen (ignorierten) ID3-Metadaten. |
OGG_OPUS |
Opus-Audioframes in einem Ogg-Container. |
WEBM_OPUS |
Opus-Audioframes in einem WebM-Container. |
MP4_AAC |
AAC-Audioframes in einem MP4-Container. |
M4A_AAC |
AAC-Audioframes in einem M4A-Container. |
MOV_AAC |
AAC-Audioframes in einem MOV-Container. |
GcsOutputConfig
Ausgabekonfigurationen für Cloud Storage.
| Felder | |
|---|---|
uri |
Das Präfix des Cloud Storage-URI, mit dem die Erkennungsergebnisse geschrieben werden. |
GetConfigRequest
Anfragenachricht für die Methode GetConfig.
| Felder | |
|---|---|
name |
Erforderlich. Der Name der abzurufenden Konfiguration. Es gibt genau eine Konfigurationsressource pro Projekt und Standort. Das erwartete Format ist |
GetCustomClassRequest
Anfragenachricht für die Methode GetCustomClass.
| Felder | |
|---|---|
name |
Erforderlich. Der Name der abzurufenden CustomClass. Das erwartete Format ist |
GetPhraseSetRequest
Anfragenachricht für die Methode GetPhraseSet.
| Felder | |
|---|---|
name |
Erforderlich. Der Name des abzurufenden PhraseSet. Das erwartete Format ist |
GetRecognizerRequest
Anfragenachricht für die Methode GetRecognizer.
| Felder | |
|---|---|
name |
Erforderlich. Der Name des abzurufenden Recognizers. Das erwartete Format ist |
InlineOutputConfig
Dieser Typ hat keine Felder.
Ausgabekonfigurationen für Inline-Antworten.
InlineResult
Die endgültigen Ergebnisse werden inline in der Erkennungsantwort zurückgegeben.
| Felder | |
|---|---|
transcript |
Das Transkript für die Audiodatei. |
vtt_captions |
Das Transkript der Audiodatei als VTT-formatierte Untertitel. Dieses Feld wird nur ausgefüllt, wenn die |
srt_captions |
Das Transkript der Audiodatei als SRT-formatierte Untertitel. Dieses Feld wird nur ausgefüllt, wenn die |
LanguageMetadata
Die Metadaten zu den in einer bestimmten Region verfügbaren Sprachen. Derzeit sind das nur die Modelle, die für die einzelnen Sprachen verfügbar sind.
| Felder | |
|---|---|
models |
Karte der Sprache (Sprachcode) -> Modelle |
ListCustomClassesRequest
Anfragenachricht für die Methode ListCustomClasses.
| Felder | |
|---|---|
parent |
Erforderlich. Das Projekt und der Standort der aufzulistenden CustomClass-Ressourcen. Das erwartete Format ist |
page_size |
Anzahl der Ergebnisse pro Anfrage. Ein gültiger page_size-Wert liegt zwischen 0 und 100 (einschließlich). Wenn „page_size“ null oder nicht angegeben ist, wird eine Seitengröße von 5 ausgewählt. Wenn die Seitengröße 100 überschreitet, wird sie auf 100 reduziert. Beachten Sie, dass bei einem Aufruf möglicherweise weniger Ergebnisse als die angeforderte Seitengröße zurückgegeben werden. |
page_token |
Ein Seitentoken, das von einem vorherigen Beim Paginieren müssen alle anderen für |
show_deleted |
Gibt an, ob gelöschte Ressourcen angezeigt werden sollen. |
ListCustomClassesResponse
Antwortnachricht für die Methode ListCustomClasses.
| Felder | |
|---|---|
custom_classes[] |
Die Liste der angeforderten CustomClasses. |
next_page_token |
Ein Token, das als |
ListPhraseSetsRequest
Anfragenachricht für die Methode ListPhraseSets.
| Felder | |
|---|---|
parent |
Erforderlich. Das Projekt und der Standort der aufzulistenden PhraseSet-Ressourcen. Das erwartete Format ist |
page_size |
Die maximale Anzahl der zurückzugebenden PhraseSets. Der Dienst gibt möglicherweise weniger als diesen Wert zurück. Falls nicht angegeben, werden maximal 5 PhraseSets zurückgegeben. Der Höchstwert beträgt 100. Werte über 100 werden implizit auf 100 umgewandelt. |
page_token |
Ein Seitentoken, das von einem vorherigen Beim Paginieren müssen alle anderen für |
show_deleted |
Gibt an, ob gelöschte Ressourcen angezeigt werden sollen. |
ListPhraseSetsResponse
Antwortnachricht für die Methode ListPhraseSets.
| Felder | |
|---|---|
phrase_sets[] |
Die Liste der angeforderten PhraseSets. |
next_page_token |
Ein Token, das als |
ListRecognizersRequest
Anfragenachricht für die Methode ListRecognizers.
| Felder | |
|---|---|
parent |
Erforderlich. Das Projekt und der Standort der aufzulistenden Recognizers. Das erwartete Format ist |
page_size |
Die maximale Anzahl der zurückzugebenden Recognizers. Der Dienst gibt möglicherweise weniger als diesen Wert zurück. Wenn nicht angegeben, werden maximal 5 Recognizer zurückgegeben. Der Höchstwert beträgt 100. Werte über 100 werden implizit auf 100 umgewandelt. |
page_token |
Ein Seitentoken, das von einem vorherigen Beim Paginieren müssen alle anderen für |
show_deleted |
Gibt an, ob gelöschte Ressourcen angezeigt werden sollen. |
ListRecognizersResponse
Antwortnachricht für die Methode ListRecognizers.
| Felder | |
|---|---|
recognizers[] |
Die Liste der angeforderten Recognizers. |
next_page_token |
Ein Token, das als |
LocationsMetadata
Hauptmetadaten für die Locations API für STT V2. Derzeit sind das nur die Metadaten zu Sprachen, Modellen und Funktionen.
| Felder | |
|---|---|
languages |
Informationen zu verfügbaren Gebietsschemas, Modellen und Funktionen, die in der hierarchischen Struktur von Gebietsschemas –> Modellen –> Funktionen dargestellt werden |
access_metadata |
Informationen zu den Zugriffsmetadaten für die Region und das angegebene Projekt. |
ModelFeature
Stellt ein einzelnes Feature eines Modells dar. Wenn das Feature recognizer ist, entspricht der release_state des Features dem release_state des Modells.
| Felder | |
|---|---|
feature |
Der Name des Features (Hinweis: Das Feature kann |
release_state |
Der Veröffentlichungsstatus der Funktion |
ModelFeatures
Stellt die Sammlung von Features dar, die zu einem Modell gehören.
| Felder | |
|---|---|
model_feature[] |
Wiederkehrendes Feld, das alle Merkmale des Modells enthält |
ModelMetadata
Die Metadaten zu den Modellen in einer bestimmten Region für ein bestimmtes Gebietsschema. Derzeit sind das nur die Funktionen des Modells.
| Felder | |
|---|---|
model_features |
Zuordnung von Modellname –> Funktionen des Modells |
NativeOutputFileFormatConfig
Dieser Typ hat keine Felder.
Ausgabekonfigurationen für serialisierte BatchRecognizeResults-Protos.
OperationMetadata
Stellt die Metadaten eines Vorgangs mit langer Ausführungszeit dar.
| Felder | |
|---|---|
create_time |
Die Zeit, zu der der Vorgang erstellt wurde. |
update_time |
Der Zeitpunkt, zu dem der Vorgang zuletzt aktualisiert wurde. |
resource |
Der Ressourcenpfad für das Ziel des Vorgangs. |
method |
Die Methode, die den Vorgang ausgelöst hat. |
kms_key_name |
Der KMS-Schlüsselname, mit dem der Inhalt des Vorgangs verschlüsselt wird. Das erwartete Format ist |
kms_key_version_name |
Der Name der KMS-Schlüsselversion, mit der der Inhalt des Vorgangs verschlüsselt wird. Das erwartete Format ist |
progress_percent |
Der prozentuale Fortschritt des Vorgangs. Die Werte können zwischen 0 und 100 liegen. Wenn der Wert 100 ist, ist der Vorgang abgeschlossen. |
Union-Feld request. Die Anfrage, die den Vorgang ausgelöst hat. Für request ist nur einer der folgenden Werte zulässig: |
|
batch_recognize_request |
Die BatchRecognizeRequest, die den Vorgang ausgelöst hat. |
create_recognizer_request |
Die CreateRecognizerRequest, die den Vorgang ausgelöst hat. |
update_recognizer_request |
Die UpdateRecognizerRequest, die den Vorgang ausgelöst hat. |
delete_recognizer_request |
Die DeleteRecognizerRequest, die den Vorgang ausgelöst hat. |
undelete_recognizer_request |
Die UndeleteRecognizerRequest, die den Vorgang ausgelöst hat. |
create_custom_class_request |
Die CreateCustomClassRequest, die den Vorgang ausgelöst hat. |
update_custom_class_request |
Die UpdateCustomClassRequest, die den Vorgang ausgelöst hat. |
delete_custom_class_request |
Die DeleteCustomClassRequest, die den Vorgang ausgelöst hat. |
undelete_custom_class_request |
Die UndeleteCustomClassRequest, die den Vorgang ausgelöst hat. |
create_phrase_set_request |
Die CreatePhraseSetRequest, die den Vorgang ausgelöst hat. |
update_phrase_set_request |
Die UpdatePhraseSetRequest, die den Vorgang ausgelöst hat. |
delete_phrase_set_request |
Die DeletePhraseSetRequest, die den Vorgang ausgelöst hat. |
undelete_phrase_set_request |
Die UndeletePhraseSetRequest, die den Vorgang ausgelöst hat. |
update_config_request |
Die UpdateConfigRequest, die den Vorgang ausgelöst hat. |
Union-Feld metadata. Spezifische Metadaten pro RPC. Für metadata ist nur einer der folgenden Werte zulässig: |
|
batch_recognize_metadata |
Metadaten, die für die BatchRecognize-Methode spezifisch sind. |
OutputFormatConfig
Konfiguration für das Format der Ergebnisse, die in output gespeichert werden.
| Felder | |
|---|---|
native |
Konfiguration für das native Ausgabeformat. Wenn dieses Feld festgelegt ist oder kein anderes Ausgabefeld für das Format festgelegt ist, werden Transkripte im nativen Format in die Senke geschrieben. |
vtt |
Konfiguration für das VTT-Ausgabeformat. Wenn dieses Feld festgelegt ist, werden Transkripte im VTT-Format in die Senke geschrieben. |
srt |
Konfiguration für das SRT-Ausgabeformat. Wenn dieses Feld festgelegt ist, werden Transkripte im SRT-Format in die Senke geschrieben. |
PhraseSet
PhraseSet für die Gewichtung bei der Spracherkennung. Mit einem PhraseSet werden dem Spracherkennungsmodul „Hinweise“ für bestimmte Wörter und Wortgruppen gegeben, die bei den Ergebnissen zu bevorzugen sind.
| Felder | |
|---|---|
name |
Nur Ausgabe. ID. Der Ressourcenname des PhraseSets. Format: |
uid |
Nur Ausgabe. Vom System zugewiesene eindeutige Kennung für das PhraseSet. |
phrases[] |
Eine Liste mit Wörtern und Wortgruppen. |
boost |
Hinweis-Boost Ein positiver Wert erhöht die Wahrscheinlichkeit, dass eine bestimmte Wortgruppe gegenüber anderen ähnlich klingenden Wortgruppen erkannt wird. Je höher der Boost, desto höher ist auch die Wahrscheinlichkeit einer fälschlichen Erkennung. Gültige |
display_name |
Vom Nutzer festlegbarer, für Menschen lesbarer Name für den PhraseSet. Darf höchstens 63 Zeichen lang sein. |
state |
Nur Ausgabe. Der Lebenszyklusstatus des PhraseSets. |
create_time |
Nur Ausgabe. Erstellungszeit. |
update_time |
Nur Ausgabe. Der Zeitpunkt der letzten Änderung an dieser Ressource. |
delete_time |
Nur Ausgabe. Der Zeitpunkt, zu dem das Löschen dieser Ressource angefordert wurde. |
expire_time |
Nur Ausgabe. Der Zeitpunkt, zu dem diese Ressource gelöscht wird. |
annotations |
Ermöglicht Nutzern das Speichern kleiner Mengen beliebiger Daten. Sowohl der Schlüssel als auch der Wert dürfen jeweils maximal 63 Zeichen lang sein. Maximal 100 Annotationen. |
etag |
Nur Ausgabe. Diese Prüfsumme wird vom Server auf Grundlage des Werts anderer Felder berechnet. Kann bei Aktualisierungs-, Wiederherstellungs- und Löschanfragen gesendet werden, um sicherzustellen, dass der Client vor dem Fortfahren einen aktuellen Wert hat. |
reconciling |
Nur Ausgabe. Gibt an, ob dieses PhraseSet gerade aktualisiert wird. |
kms_key_name |
Nur Ausgabe. Der KMS-Schlüsselname, mit dem das PhraseSet verschlüsselt wird. Das erwartete Format ist |
kms_key_version_name |
Nur Ausgabe. Der Name der KMS-Schlüsselversion, mit der das PhraseSet verschlüsselt wird. Das erwartete Format ist |
Wortgruppe
Ein Phrase-Objekt enthält Wörter und Wortgruppen-„Hinweise“, damit die Spracherkennung sie mit größerer Wahrscheinlichkeit erkennt. Kann zur Verbesserung der Genauigkeit für bestimmte Wörter und Wendungen verwendet werden, z. B. wenn der Nutzer bestimmte Befehle häufig spricht. Lässt sich ebenfalls verwenden, um weitere Wörter zum Vokabular des Erkennungsmoduls hinzuzufügen.
Listenelemente können auch CustomClass-Verweise enthalten, die Gruppen von Wörtern enthalten, die gängige Konzepte in natürlicher Sprache darstellen.
| Felder | |
|---|---|
value |
Die Wortgruppe selbst. |
boost |
Hinweis-Boost Überschreibt die Optimierung, die auf Wortgruppensatzebene festgelegt ist. Ein positiver Wert erhöht die Wahrscheinlichkeit, dass eine bestimmte Wortgruppe gegenüber anderen ähnlich klingenden Wortgruppen erkannt wird. Je höher der Boost, desto höher ist auch die Wahrscheinlichkeit einer fälschlichen Erkennung. Negative Boost-Werte entsprechen der Anti-Bias-Funktion. Die Funktion zur Vermeidung von Bias ist nicht aktiviert. Daher wird bei negativen Steigerungswerten ein Fehler zurückgegeben. Die Optimierungswerte müssen zwischen 0 und 20 liegen. Bei Werten außerhalb dieses Bereichs wird ein Fehler zurückgegeben. Wir empfehlen, den optimalen Wert für Ihren Anwendungsfall mithilfe einer binären Suche zu ermitteln und Ihren Anfragen sowohl Begriffe mit als auch ohne Steigerung hinzuzufügen. |
Bundesland
Eine Reihe von Status, die den Lebenszyklus eines PhraseSet definieren.
| Enums | |
|---|---|
STATE_UNSPECIFIED |
Nicht angegebener Zustand. Dies wird nur verwendet, um nicht festgelegte Werte zu unterscheiden. |
ACTIVE |
Der normale und der aktive Status. |
DELETED |
Dieses PhraseSet wurde gelöscht. |
RecognitionConfig
Stellt dem Erkennungsmodul Informationen zur Verarbeitung der Erkennungsanfrage zur Verfügung.
| Felder | |
|---|---|
model |
Optional. Welches Modell für Erkennungsanfragen verwendet werden soll. Wählen Sie das für Ihre Domain am besten geeignete Modell aus, um die besten Ergebnisse zu erzielen. Eine Anleitung zur Auswahl des zu verwendenden Modells finden Sie in der Dokumentation zu Transkriptionsmodellen. Die in den einzelnen Regionen unterstützten Modelle finden Sie in der Tabelle der unterstützten Modelle. |
language_codes[] |
Optional. Die Sprache der übermittelten Audiodaten, angegeben als BCP-47-Sprachcode. Sprachtags werden vor der Verwendung normalisiert, z. B. wird „en-us“ zu „en-US“. Die unterstützten Sprachen für die einzelnen Modelle sind in der Tabelle der unterstützten Modelle aufgeführt. Wenn zusätzliche Sprachen angegeben werden, enthält das Erkennungsergebnis die Erkennung in der wahrscheinlichsten erkannten Sprache. Das Erkennungsergebnis enthält den Sprachcode der Sprache, die in dem Audio erkannt wird. |
features |
Spracherkennungsfunktionen, die aktiviert werden müssen. |
adaptation |
Kontext für die Sprachanpassung, der die Vorhersagen des Erkennungsmoduls für bestimmte Wörter und Wortgruppen gewichtet. |
transcript_normalization |
Optional. Mit der Transkriptnormalisierung können Sie automatisch bestimmte Teile des Transkripts durch von Ihnen ausgewählte Formulierungen ersetzen lassen. Bei StreamingRecognize gilt diese Normalisierung nur für stabile Teiltranskripte (Stabilität > 0, 8) und endgültige Transkripte. |
translation_config |
Optional. Optionale Konfiguration, die verwendet wird, um die Übersetzung des angegebenen Audios in die gewünschte Sprache für unterstützte Modelle automatisch auszuführen. |
denoiser_config |
Optional. Optionale Konfiguration der Rauschunterdrückung. Wird möglicherweise nicht für alle Modelle unterstützt und hat möglicherweise keine Auswirkungen. |
Union-Feld decoding_config. Parameter für die Dekodierung von Audio, das zur Erkennung gesendet wird. Für decoding_config ist nur einer der folgenden Werte zulässig: |
|
auto_decoding_config |
Decodierungsparameter automatisch erkennen. Bevorzugt für unterstützte Formate. |
explicit_decoding_config |
Explizit angegebene Decodierungsparameter. Erforderlich bei Verwendung von Header ohne PCM-Audio (linear16, mulaw, alaw). |
RecognitionFeatures
Verfügbare Erkennungsfunktionen.
| Felder | |
|---|---|
profanity_filter |
Wenn der Wert auf |
enable_word_time_offsets |
Bei |
enable_word_confidence |
Bei |
enable_automatic_punctuation |
Wenn |
enable_spoken_punctuation |
Das Verhalten der gesprochenen Satzzeichen für den Anruf. Wenn |
enable_spoken_emojis |
Das Verhalten der gesprochenen Emojis für den Anruf. Wenn |
multi_channel_mode |
Modus für die Erkennung von Mehrkanalaudio. |
diarization_config |
Konfiguration zum Aktivieren der Sprecherbestimmung. Wenn Sie die Sprecherbestimmung aktivieren möchten, legen Sie dieses Feld auf eine leere SpeakerDiarizationConfig-Nachricht fest. |
max_alternatives |
Maximale Anzahl der zurückzugebenden Erkennungshypothesen. Der Server gibt möglicherweise weniger als |
MultiChannelMode
Optionen für die Erkennung von Mehrkanal-Audio.
| Enums | |
|---|---|
MULTI_CHANNEL_MODE_UNSPECIFIED |
Standardwert für den Multi-Channel-Modus. Wenn der Audioinhalt mehrere Kanäle enthält, wird nur der erste Kanal transkribiert. Die anderen Kanäle werden ignoriert. |
SEPARATE_RECOGNITION_PER_CHANNEL |
Wenn diese Option ausgewählt ist, wird jeder Kanal im bereitgestellten Audio unabhängig transkribiert. Diese Option kann nicht ausgewählt werden, wenn die ausgewählte model gleich latest_short ist. |
RecognitionOutputConfig
Konfigurationsoptionen für die Ausgabe(n) der Erkennung.
| Felder | |
|---|---|
output_format_config |
Optional. Konfiguration für das Format der Ergebnisse, die in |
Union-Feld Für |
|
gcs_output_config |
Wenn diese Meldung angezeigt wird, werden die Erkennungsergebnisse in den angegebenen Google Cloud Storage-URI geschrieben. |
inline_response_config |
Wenn diese Meldung ausgefüllt ist, werden die Erkennungsergebnisse nach Abschluss des Vorgangs in der Meldung |
RecognitionResponseMetadata
Metadaten zur Erkennungsanfrage und ‑antwort.
| Felder | |
|---|---|
request_id |
Globale Anfrage-ID, die automatisch von der API generiert wird. |
total_billed_duration |
Wenn verfügbar, die abgerechneten Audiosekunden für die entsprechende Anfrage. |
RecognizeRequest
Anfragenachricht für die Methode Recognize. Es muss entweder content oder uri angegeben werden. Wenn Sie beide oder keine Werte angeben, wird INVALID_ARGUMENT zurückgegeben. Weitere Informationen
| Felder | |
|---|---|
recognizer |
Erforderlich. Der Name des Recognizer, der während der Erkennung verwendet werden soll. Das erwartete Format ist |
config |
Funktionen und Audiometadaten, die für die automatische Spracherkennung verwendet werden sollen. Mit diesem Feld in Kombination mit dem Feld |
config_mask |
Die Liste der Felder in |
Union-Feld audio_source. Die Audioquelle, bei der es sich um Inline-Content oder einen Google Cloud Storage-URI handelt. Für audio_source ist nur einer der folgenden Werte zulässig: |
|
content |
Die in |
uri |
URI, der auf eine Datei verweist, die Audiodatenbyte enthält, wie in |
RecognizeResponse
Antwortnachricht für die Methode Recognize.
| Felder | |
|---|---|
results[] |
Sequenzielle Liste der Transkriptionsergebnisse, die den sequenziellen Teilen einer Audiodatei entsprechen. |
metadata |
Metadaten zur Erkennung. |
Erkennungssystem
Eine Nachricht vom Erkennungssystem. Speichert die Erkennungskonfiguration und ‑metadaten.
| Felder | |
|---|---|
name |
Nur Ausgabe. ID. Der Ressourcenname des Recognizer. Format: |
uid |
Nur Ausgabe. Vom System zugewiesene eindeutige Kennung für den Recognizer. |
display_name |
Vom Nutzer festlegbarer, für Menschen lesbarer Name für den Recognizer. Darf höchstens 63 Zeichen lang sein. |
model |
Optional. Dieses Feld wurde eingestellt. Das Feld Welches Modell für Erkennungsanfragen verwendet werden soll. Wählen Sie das für Ihre Domain am besten geeignete Modell aus, um die besten Ergebnisse zu erzielen. Eine Anleitung zur Auswahl des zu verwendenden Modells finden Sie in der Dokumentation zu Transkriptionsmodellen. Die in den einzelnen Regionen unterstützten Modelle finden Sie in der Tabelle der unterstützten Modelle. |
language_codes[] |
Optional. Dieses Feld wurde eingestellt. Das Feld Die Sprache der übermittelten Audiodaten, angegeben als BCP-47-Sprachcode. Die unterstützten Sprachen für die einzelnen Modelle sind in der Tabelle der unterstützten Modelle aufgeführt. Wenn zusätzliche Sprachen angegeben werden, enthält das Erkennungsergebnis die Erkennung in der wahrscheinlichsten erkannten Sprache. Das Erkennungsergebnis enthält den Sprachcode der Sprache, die in dem Audio erkannt wird. Wenn Sie einen Recognizer erstellen oder aktualisieren, werden diese Werte in normalisierter BCP-47-Form gespeichert. Beispiel: „en-us“ wird als „en-US“ gespeichert. |
default_recognition_config |
Standardkonfiguration für Anfragen mit diesem Recognizer. Dies kann durch die Inline-Konfiguration im Feld |
annotations |
Ermöglicht Nutzern das Speichern kleiner Mengen beliebiger Daten. Sowohl der Schlüssel als auch der Wert dürfen jeweils maximal 63 Zeichen lang sein. Maximal 100 Annotationen. |
state |
Nur Ausgabe. Der Lebenszyklusstatus des Erkennungssystems. |
create_time |
Nur Ausgabe. Erstellungszeit. |
update_time |
Nur Ausgabe. Der Zeitpunkt der letzten Änderung dieses Recognizers. |
delete_time |
Nur Ausgabe. Der Zeitpunkt, zu dem das Löschen dieses Recognizers angefordert wurde. |
expire_time |
Nur Ausgabe. Der Zeitpunkt, zu dem dieser Recognizer gelöscht wird. |
etag |
Nur Ausgabe. Diese Prüfsumme wird vom Server auf Grundlage des Werts anderer Felder berechnet. Kann bei Aktualisierungs-, Wiederherstellungs- und Löschanfragen gesendet werden, um sicherzustellen, dass der Client vor dem Fortfahren einen aktuellen Wert hat. |
reconciling |
Nur Ausgabe. Gibt an, ob dieser Recognizer gerade aktualisiert wird. |
kms_key_name |
Nur Ausgabe. Der KMS-Schlüsselname, mit dem der Recognizer verschlüsselt wird. Das erwartete Format ist |
kms_key_version_name |
Nur Ausgabe. Der Name der KMS-Schlüsselversion, mit der der Recognizer verschlüsselt wird. Das erwartete Format ist |
Bundesland
Eine Reihe von Status, die den Lebenszyklus eines Recognizer definieren.
| Enums | |
|---|---|
STATE_UNSPECIFIED |
Der Standardwert. Dieser Wert wird verwendet, wenn der Bundesstaat weggelassen wird. |
ACTIVE |
Der Recognizer ist aktiv und einsatzbereit. |
DELETED |
Dieser Recognizer wurde gelöscht. |
SpeakerDiarizationConfig
Konfiguration zum Aktivieren der Sprecherbestimmung.
| Felder | |
|---|---|
min_speaker_count |
Optional. Das System bestimmt automatisch die Anzahl der Lautsprecher. Dieser Wert wird derzeit nicht verwendet. |
max_speaker_count |
Optional. Das System bestimmt automatisch die Anzahl der Lautsprecher. Dieser Wert wird derzeit nicht verwendet. |
SpeechAdaptation
Liefert dem Spracherkennungsmodul "Hinweise" für bestimmte Wörter und Wendungen, die bei den Ergebnissen zu bevorzugen sind. PhraseSets können als Inline-Ressource oder als Verweis auf eine vorhandene PhraseSet-Ressource angegeben werden.
| Felder | |
|---|---|
phrase_sets[] |
Eine Liste mit Inline- oder referenzierten PhraseSets. |
custom_classes[] |
Eine Liste mit Inline-CustomClasses. Auf vorhandene CustomClass-Ressourcen kann direkt in einem PhraseSet verwiesen werden. |
AdaptationPhraseSet
Ein PhraseSet für die Bias-Einstellung, das entweder ein String ist, der auf den Namen einer vorhandenen PhraseSets-Ressource verweist, oder eine Inline-Definition eines PhraseSet.
| Felder | |
|---|---|
Union-Feld Für |
|
phrase_set |
Der Name einer vorhandenen PhraseSet-Ressource. Der Nutzer muss Lesezugriff auf die Ressource haben und sie darf nicht gelöscht werden. |
inline_phrase_set |
Ein inline definiertes PhraseSet. |
SpeechRecognitionAlternative
Alternative Hypothesen.
| Felder | |
|---|---|
transcript |
Transkriptionstext mit den vom Nutzer gesprochenen Wörtern |
confidence |
Eine Konfidenzschätzung zwischen 0,0 und 1,0. Je höher der Wert ist, desto höher ist die geschätzte Wahrscheinlichkeit, dass die Wörter korrekt erkannt wurden. Dieses Feld wird nur für die beste Alternative eines Nicht-Streaming-Ergebnisses oder eines Streaming-Ergebnisses festgelegt, bei dem |
words[] |
Eine Liste von wortspezifischen Informationen zu jedem erkannten Wort. Wenn |
SpeechRecognitionResult
Ein Spracherkennungsergebnis, das einem Teil der Audiodaten entspricht.
| Felder | |
|---|---|
alternatives[] |
Kann eine oder mehrere Erkennungshypothesen enthalten. Die Alternativen sind nach Genauigkeit geordnet. Die beste (erste) Alternative ist dabei der Einstufung des Erkennungsmoduls zufolge die wahrscheinlichste. |
channel_tag |
Bei Mehrkanalaudio ist dies die Kanalnummer, die dem erkannten Ergebnis für die Audiodaten aus diesem Kanal entspricht. Bei |
result_end_offset |
Zeitverschiebung des Endes dieses Ergebnisses relativ zum Beginn des Audios. |
language_code |
Nur Ausgabe. Der Sprachcode BCP-47 der Sprache in diesem Ergebnis. Es wurde erkannt, dass dieser Sprachcode wahrscheinlich in der Audiodatei gesprochen wird. |
SrtOutputFileFormatConfig
Dieser Typ hat keine Felder.
Ausgabekonfigurationen SubRip Text formatierte Untertiteldatei.
StreamingRecognitionConfig
Stellt Konfigurationsinformationen für die StreamingRecognize-Anfrage bereit.
| Felder | |
|---|---|
config |
Erforderlich. Funktionen und Audiometadaten, die für die automatische Spracherkennung verwendet werden sollen. Mit diesem Feld in Kombination mit dem Feld |
config_mask |
Die Liste der Felder in |
streaming_features |
Spracherkennungsfunktionen, die für Anfragen zur Streaming-Audioerkennung aktiviert sind. |
StreamingRecognitionFeatures
Verfügbare Erkennungsfunktionen speziell für Anfragen zur Streamingerkennung.
| Felder | |
|---|---|
enable_voice_activity_events |
Wenn |
interim_results |
Gibt an, ob Zwischenergebnisse an den Client gestreamt werden sollen. Wenn der Wert auf „true“ gesetzt ist, werden Zwischenergebnisse an den Client gestreamt. Andernfalls wird nur die endgültige Antwort zurückgegeben. |
voice_activity_timeout |
Wenn festgelegt, schließt der Server den Stream automatisch, nachdem die angegebene Dauer seit dem Senden des letzten VOICE_ACTIVITY-Sprachereignisses verstrichen ist. Das Feld |
VoiceActivityTimeout
Ereignisse, für die ein Zeitlimit für Sprachaktivitäten festgelegt werden kann.
| Felder | |
|---|---|
speech_start_timeout |
Dauer, nach der der Stream beendet wird, wenn keine Sprache erkannt wird. Wenn dieser Wert festgelegt ist und zu Beginn des Streams innerhalb dieses Zeitraums keine Sprache erkannt wird, schließt der Server den Stream. |
speech_end_timeout |
Dauer, nach der der Stream beendet wird, nachdem die Sprache beendet wurde. Wenn dies festgelegt ist und innerhalb dieses Zeitraums nach der Erkennung von Sprache keine Sprache erkannt wird, schließt der Server den Stream. |
StreamingRecognitionResult
Ein Erkennungsergebnis für gestreamte Sprache, das einem Teil der Audiodaten entspricht, die aktuell verarbeitet werden.
| Felder | |
|---|---|
alternatives[] |
Kann eine oder mehrere Erkennungshypothesen enthalten. Die Alternativen sind nach Genauigkeit geordnet. Die beste (erste) Alternative ist dabei der Einstufung des Erkennungsmoduls zufolge die wahrscheinlichste. |
is_final |
Bei |
stability |
Eine Schätzung der Wahrscheinlichkeit dafür, dass die Vermutung im Hinblick auf dieses Zwischenergebnis vom Erkennungsmodul nicht geändert wird. Die Werte reichen von 0,0 (vollständig unzuverlässig) bis 1,0 (vollständig zuverlässig). Dieses Feld wird nur für Zwischenergebnisse ( |
result_end_offset |
Zeitverschiebung des Endes dieses Ergebnisses relativ zum Beginn des Audios. |
channel_tag |
Bei Mehrkanalaudio ist dies die Kanalnummer, die dem erkannten Ergebnis für die Audiodaten aus diesem Kanal entspricht. Bei |
language_code |
Nur Ausgabe. Der Sprachcode BCP-47 der Sprache in diesem Ergebnis. Es wurde erkannt, dass dieser Sprachcode wahrscheinlich in der Audiodatei gesprochen wird. |
StreamingRecognizeRequest
Anfragenachricht für die Methode StreamingRecognize. Es werden mehrere StreamingRecognizeRequest-Nachrichten in einem Aufruf gesendet.
Wenn die von recognizer referenzierte Recognizer eine vollständig angegebene Anfragekonfiguration enthält, darf der Stream nur Nachrichten mit nur audio enthalten.
Andernfalls muss die erste Nachricht eine recognizer- und eine streaming_config-Nachricht enthalten, die zusammen die Anfragekonfiguration vollständig angeben, und darf keine audio-Nachricht enthalten. In allen nachfolgenden Nachrichten darf nur audio festgelegt sein.
| Felder | |
|---|---|
recognizer |
Erforderlich. Der Name des Recognizer, der während der Erkennung verwendet werden soll. Das erwartete Format ist |
Union-Feld Für |
|
streaming_config |
StreamingRecognitionConfig, die bei diesem Erkennungsversuch verwendet werden soll. Falls angegeben, wird damit die im Recognizer gespeicherte Standard-RecognitionConfig überschrieben. |
audio |
Inline-Audiobytes, die erkannt werden sollen. Die maximale Größe für dieses Feld beträgt 15 KB pro Anfrage. |
StreamingRecognizeResponse
StreamingRecognizeResponse ist die einzige Nachricht, die von StreamingRecognize an den Client zurückgegeben wird. Eine Reihe von null oder mehr StreamingRecognizeResponse-Nachrichten werden an den Client zurückgestreamt. Wenn kein Audio erkannt wird, werden keine Nachrichten an den Client zurückgestreamt.
Hier sind einige Beispiele für StreamingRecognizeResponse, die bei der Audioverarbeitung zurückgegeben werden können:
results { alternatives { transcript: "seihen" } stability: 0.01 }
results { alternatives { transcript: "seiner" } stability: 0.01 }
results { alternatives { transcript: "sein" } stability: 0.9 } results { alternatives { transcript: " oder nicht sein" } stability: 0.01 }
results { alternatives { transcript: "sein oder nicht sein" confidence: 0.92 } alternatives { transcript: "seihen oder nicht seihen" } is_final: true }
results { alternatives { transcript: " dass ist" } stability: 0.01 }
results { alternatives { transcript: " das ist" } stability: 0.9 } results { alternatives { transcript: " hier die Frage" } stability: 0.01 }
results { alternatives { transcript: " das ist die Frage" confidence: 0.98 } alternatives { transcript: " das war die Frage" } is_final: true }
Hinweise:
Nur zwei der oben genannten Antworten (Nr. 4 und Nr. 7) enthalten endgültige Ergebnisse, die durch
is_final: truegekennzeichnet sind. Werden diese Ergebnisse zusammengefügt, erhält man das vollständige Transkript: "sein oder nicht sein, das ist die Frage".Die anderen enthalten Zwischenwerte
results. #3 und #6 enthalten zwei vorläufigeresults: Der erste Abschnitt weist eine hohe Stabilität auf und ist weniger anfällig für Änderungen. Der zweite Teil hat eine geringe Stabilität und wird sich wahrscheinlich ändern. Ein UI-Designer kann sich dafür entscheiden, nurresultsmit hoher Stabilität anzuzeigen.Die oben angegebenen spezifischen Werte für
stabilityundconfidencedienen nur zur Veranschaulichung. Die tatsächlichen Werte können davon abweichen.In jeder Antwort wird nur eines der folgenden Felder festgelegt:
error,speech_event_typeoder eines oder mehrere (wiederholte)results.
| Felder | |
|---|---|
results[] |
Diese wiederholte Liste enthält null oder mehr Ergebnisse, die aufeinanderfolgenden Teilen der aktuell bearbeiteten Audiodaten entsprechen. Sie enthält null oder ein |
speech_event_type |
Gibt die Art des Sprachereignisses an. |
speech_event_offset |
Zeitverschiebung zwischen dem Beginn der Audio- und der Ereignisemission. |
metadata |
Metadaten zur Erkennung. |
SpeechEventType
Gibt die Art des Sprachereignisses an.
| Enums | |
|---|---|
SPEECH_EVENT_TYPE_UNSPECIFIED |
Kein Sprachereignis angegeben. |
END_OF_SINGLE_UTTERANCE |
Mit diesem Ereignis wird angezeigt, dass vom Server das Ende der sprachlichen Äußerung des Nutzers erkannt wurde und keine weiteren Sprachdaten erwartet werden. Daher werden keine weiteren Audiodaten vom Server verarbeitet und der bidirektionale gRPC-Stream wird geschlossen. Dieses Ereignis wird nur gesendet, wenn es aufgrund von Stille, die frühzeitig erkannt wurde, zu einem erzwungenen Abbruch kam. Diese Veranstaltung ist nur über die latest_short model verfügbar. |
SPEECH_ACTIVITY_BEGIN |
Dieses Ereignis gibt an, dass der Server den Beginn der menschlichen Sprachaktivität im Stream erkannt hat. Dieses Ereignis kann mehrmals zurückgegeben werden, wenn die Sprache im Stream wiederholt beginnt und endet. Dieses Ereignis wird nur gesendet, wenn voice_activity_events auf „true“ gesetzt ist. |
SPEECH_ACTIVITY_END |
Dieses Ereignis gibt an, dass der Server das Ende der menschlichen Sprachaktivität im Stream erkannt hat. Dieses Ereignis kann mehrmals zurückgegeben werden, wenn die Sprache im Stream wiederholt beginnt und endet. Dieses Ereignis wird nur gesendet, wenn voice_activity_events auf „true“ gesetzt ist. |
TranscriptNormalization
Konfiguration der Transkriptionsnormalisierung. Mit der Transkriptnormalisierung können Sie automatisch bestimmte Teile des Transkripts durch von Ihnen ausgewählte Formulierungen ersetzen lassen. Bei StreamingRecognize gilt diese Normalisierung nur für stabile Teiltranskripte (Stabilität > 0, 8) und endgültige Transkripte.
| Felder | |
|---|---|
entries[] |
Eine Liste mit Ersatzeinträgen. Wir werden jeweils einen Eintrag ersetzen. Der zweite Eintrag in ["cat" => "dog", "mountain cat" => "mountain dog"] wird beispielsweise nie angewendet, da der erste Eintrag immer zuerst verarbeitet wird. Maximal 100 Einträge. |
Eintrag
Eine einzelne Ersatzkonfiguration.
| Felder | |
|---|---|
search |
Was ersetzt werden soll. Darf maximal 100 Zeichen lang sein. |
replace |
Wodurch soll sie ersetzt werden? Darf maximal 100 Zeichen lang sein. |
case_sensitive |
Gibt an, ob bei der Suche zwischen Groß- und Kleinschreibung unterschieden wird. |
TranslationConfig
Übersetzungskonfiguration. Wird verwendet, um die angegebenen Audioinhalte in Text für die gewünschte Sprache zu übersetzen.
| Felder | |
|---|---|
target_language |
Erforderlich. Der Sprachcode, in den übersetzt werden soll. |
UndeleteCustomClassRequest
Anfragenachricht für die Methode UndeleteCustomClass.
| Felder | |
|---|---|
name |
Erforderlich. Der Name der CustomClass, die wiederhergestellt werden soll. Format: |
validate_only |
Wenn festgelegt, wird die Anfrage validiert und eine Vorschau der nicht gelöschten CustomClass angezeigt, sie wird aber nicht tatsächlich wiederhergestellt. |
etag |
Diese Prüfsumme wird vom Server auf Grundlage des Werts anderer Felder berechnet. Kann bei Aktualisierungs-, Wiederherstellungs- und Löschanfragen gesendet werden, um sicherzustellen, dass der Client vor dem Fortfahren einen aktuellen Wert hat. |
UndeletePhraseSetRequest
Anfragenachricht für die Methode UndeletePhraseSet.
| Felder | |
|---|---|
name |
Erforderlich. Der Name des PhraseSets, dessen Löschung rückgängig gemacht werden soll. Format: |
validate_only |
Wenn festgelegt, wird die Anfrage validiert und eine Vorschau des nicht gelöschten PhraseSet erstellt, es wird aber nicht tatsächlich wiederhergestellt. |
etag |
Diese Prüfsumme wird vom Server auf Grundlage des Werts anderer Felder berechnet. Kann bei Aktualisierungs-, Wiederherstellungs- und Löschanfragen gesendet werden, um sicherzustellen, dass der Client vor dem Fortfahren einen aktuellen Wert hat. |
UndeleteRecognizerRequest
Anfragenachricht für die Methode UndeleteRecognizer.
| Felder | |
|---|---|
name |
Erforderlich. Der Name des Erkennungsmoduls, das wiederhergestellt werden soll. Format: |
validate_only |
Wenn festgelegt, wird die Anfrage validiert und eine Vorschau der nicht gelöschten Erkennung angezeigt, sie wird aber nicht tatsächlich wiederhergestellt. |
etag |
Diese Prüfsumme wird vom Server auf Grundlage des Werts anderer Felder berechnet. Kann bei Aktualisierungs-, Wiederherstellungs- und Löschanfragen gesendet werden, um sicherzustellen, dass der Client vor dem Fortfahren einen aktuellen Wert hat. |
UpdateConfigRequest
Anfragenachricht für die Methode UpdateConfig.
| Felder | |
|---|---|
config |
Erforderlich. Die zu aktualisierende Konfiguration. Das Feld |
update_mask |
Die Liste der zu aktualisierenden Felder. |
UpdateCustomClassRequest
Anfragenachricht für die Methode UpdateCustomClass.
| Felder | |
|---|---|
custom_class |
Erforderlich. Die zu aktualisierende CustomClass. Das Feld |
update_mask |
Die Liste der zu aktualisierenden Felder. Wenn leer, werden alle Felder für die Aktualisierung berücksichtigt. |
validate_only |
Wenn festgelegt, wird die Anfrage validiert und eine Vorschau der aktualisierten CustomClass angezeigt, sie wird aber nicht tatsächlich aktualisiert. |
UpdatePhraseSetRequest
Anfragenachricht für die Methode UpdatePhraseSet.
| Felder | |
|---|---|
phrase_set |
Erforderlich. Das zu aktualisierende PhraseSet. Das Feld |
update_mask |
Die Liste der zu aktualisierenden Felder. Wenn dieses Feld leer ist, werden alle Felder mit nicht standardmäßigen Werten für die Aktualisierung berücksichtigt. Verwenden Sie |
validate_only |
Wenn festgelegt, wird die Anfrage validiert und eine Vorschau des aktualisierten PhraseSet angezeigt, es wird aber nicht tatsächlich aktualisiert. |
UpdateRecognizerRequest
Anfragenachricht für die Methode UpdateRecognizer.
| Felder | |
|---|---|
recognizer |
Erforderlich. Der zu aktualisierende Recognizer. Das Feld |
update_mask |
Die Liste der zu aktualisierenden Felder. Wenn dieses Feld leer ist, werden alle Felder mit nicht standardmäßigen Werten für die Aktualisierung berücksichtigt. Verwenden Sie |
validate_only |
Wenn festgelegt, wird die Anfrage validiert und eine Vorschau des aktualisierten Recognizers angezeigt, er wird aber nicht tatsächlich aktualisiert. |
VttOutputFileFormatConfig
Dieser Typ hat keine Felder.
Ausgabekonfigurationen für Untertiteldateien im WebVTT-Format.
WordInfo
Wortspezifische Informationen zu erkannten Wörtern
| Felder | |
|---|---|
start_offset |
Zeitverschiebung, bezogen auf den Beginn der Audiodaten und entsprechend dem Anfang des gesprochenen Worts. Dieses Feld wird nur bei |
end_offset |
Zeitverschiebung, bezogen auf den Beginn der Audiodaten und entsprechend dem Ende des gesprochenen Worts. Dieses Feld wird nur bei |
word |
Das Wort, auf das sich diese Informationen beziehen. |
confidence |
Eine Konfidenzschätzung zwischen 0,0 und 1,0. Je höher der Wert ist, desto höher ist die geschätzte Wahrscheinlichkeit, dass die Wörter korrekt erkannt wurden. Dieses Feld wird nur für die beste Alternative eines Nicht-Streaming-Ergebnisses oder eines Streaming-Ergebnisses festgelegt, bei dem |
speaker_label |
Jedem Sprecher im Audio wird ein eigenes Label zugewiesen. Dieses Feld gibt an, welcher dieser Sprecher jenes Wort gesprochen hat. |