Package google.cloud.speech.v2

Index

Speech

Ermöglicht die Sprachtranskription und Ressourcenverwaltung.

BatchRecognize

rpc BatchRecognize(BatchRecognizeRequest) returns (Operation)

Führt die asynchrone Batch-Spracherkennung durch: Sie senden eine Anfrage mit N Audiodateien und erhalten einen Vorgang, der lange dauert und per Polling abgefragt werden kann, um festzustellen, wann die Transkriptionen abgeschlossen sind.

Autorisierungsbereiche

Erfordert den folgenden OAuth-Bereich:

  • https://www.googleapis.com/auth/cloud-platform

Weitere Informationen finden Sie unter Authentication Overview.

IAM-Berechtigungen

Erfordert die folgende IAM-Berechtigung für die Ressource recognizer:

  • speech.recognizers.recognize

Weitere Informationen finden Sie in der IAM-Dokumentation.

CreateCustomClass

rpc CreateCustomClass(CreateCustomClassRequest) returns (Operation)

Erstellt einen CustomClass.

Autorisierungsbereiche

Erfordert den folgenden OAuth-Bereich:

  • https://www.googleapis.com/auth/cloud-platform

Weitere Informationen finden Sie unter Authentication Overview.

IAM-Berechtigungen

Erfordert die folgende IAM-Berechtigung für die Ressource parent:

  • speech.customClasses.create

Weitere Informationen finden Sie in der IAM-Dokumentation.

CreatePhraseSet

rpc CreatePhraseSet(CreatePhraseSetRequest) returns (Operation)

Erstellt einen PhraseSet.

Autorisierungsbereiche

Erfordert den folgenden OAuth-Bereich:

  • https://www.googleapis.com/auth/cloud-platform

Weitere Informationen finden Sie unter Authentication Overview.

IAM-Berechtigungen

Erfordert die folgende IAM-Berechtigung für die Ressource parent:

  • speech.phraseSets.create

Weitere Informationen finden Sie in der IAM-Dokumentation.

CreateRecognizer

rpc CreateRecognizer(CreateRecognizerRequest) returns (Operation)

Erstellt einen Recognizer.

Autorisierungsbereiche

Erfordert den folgenden OAuth-Bereich:

  • https://www.googleapis.com/auth/cloud-platform

Weitere Informationen finden Sie unter Authentication Overview.

IAM-Berechtigungen

Erfordert die folgende IAM-Berechtigung für die Ressource parent:

  • speech.recognizers.create

Weitere Informationen finden Sie in der IAM-Dokumentation.

DeleteCustomClass

rpc DeleteCustomClass(DeleteCustomClassRequest) returns (Operation)

Löscht die CustomClass.

Autorisierungsbereiche

Erfordert den folgenden OAuth-Bereich:

  • https://www.googleapis.com/auth/cloud-platform

Weitere Informationen finden Sie unter Authentication Overview.

IAM-Berechtigungen

Erfordert die folgende IAM-Berechtigung für die Ressource name:

  • speech.customClasses.delete

Weitere Informationen finden Sie in der IAM-Dokumentation.

DeletePhraseSet

rpc DeletePhraseSet(DeletePhraseSetRequest) returns (Operation)

Löscht die PhraseSet.

Autorisierungsbereiche

Erfordert den folgenden OAuth-Bereich:

  • https://www.googleapis.com/auth/cloud-platform

Weitere Informationen finden Sie unter Authentication Overview.

IAM-Berechtigungen

Erfordert die folgende IAM-Berechtigung für die Ressource name:

  • speech.phraseSets.delete

Weitere Informationen finden Sie in der IAM-Dokumentation.

DeleteRecognizer

rpc DeleteRecognizer(DeleteRecognizerRequest) returns (Operation)

Löscht die Recognizer.

Autorisierungsbereiche

Erfordert den folgenden OAuth-Bereich:

  • https://www.googleapis.com/auth/cloud-platform

Weitere Informationen finden Sie unter Authentication Overview.

IAM-Berechtigungen

Erfordert die folgende IAM-Berechtigung für die Ressource name:

  • speech.recognizers.delete

Weitere Informationen finden Sie in der IAM-Dokumentation.

GetConfig

rpc GetConfig(GetConfigRequest) returns (Config)

Gibt die angeforderte Config zurück.

Autorisierungsbereiche

Erfordert den folgenden OAuth-Bereich:

  • https://www.googleapis.com/auth/cloud-platform

Weitere Informationen finden Sie unter Authentication Overview.

IAM-Berechtigungen

Erfordert die folgende IAM-Berechtigung für die Ressource name:

  • speech.config.get

Weitere Informationen finden Sie in der IAM-Dokumentation.

GetCustomClass

rpc GetCustomClass(GetCustomClassRequest) returns (CustomClass)

Gibt die angeforderte CustomClass zurück.

Autorisierungsbereiche

Erfordert den folgenden OAuth-Bereich:

  • https://www.googleapis.com/auth/cloud-platform

Weitere Informationen finden Sie unter Authentication Overview.

IAM-Berechtigungen

Erfordert die folgende IAM-Berechtigung für die Ressource name:

  • speech.customClasses.get

Weitere Informationen finden Sie in der IAM-Dokumentation.

GetPhraseSet

rpc GetPhraseSet(GetPhraseSetRequest) returns (PhraseSet)

Gibt die angeforderte PhraseSet zurück.

Autorisierungsbereiche

Erfordert den folgenden OAuth-Bereich:

  • https://www.googleapis.com/auth/cloud-platform

Weitere Informationen finden Sie unter Authentication Overview.

IAM-Berechtigungen

Erfordert die folgende IAM-Berechtigung für die Ressource name:

  • speech.phraseSets.get

Weitere Informationen finden Sie in der IAM-Dokumentation.

GetRecognizer

rpc GetRecognizer(GetRecognizerRequest) returns (Recognizer)

Gibt die angeforderte Recognizer zurück. Schlägt mit NOT_FOUND fehl, wenn die angeforderte Erkennung nicht vorhanden ist.

Autorisierungsbereiche

Erfordert den folgenden OAuth-Bereich:

  • https://www.googleapis.com/auth/cloud-platform

Weitere Informationen finden Sie unter Authentication Overview.

IAM-Berechtigungen

Erfordert die folgende IAM-Berechtigung für die Ressource name:

  • speech.recognizers.get

Weitere Informationen finden Sie in der IAM-Dokumentation.

ListCustomClasses

rpc ListCustomClasses(ListCustomClassesRequest) returns (ListCustomClassesResponse)

Listet CustomClasses auf.

Autorisierungsbereiche

Erfordert den folgenden OAuth-Bereich:

  • https://www.googleapis.com/auth/cloud-platform

Weitere Informationen finden Sie unter Authentication Overview.

IAM-Berechtigungen

Erfordert die folgende IAM-Berechtigung für die Ressource parent:

  • speech.customClasses.list

Weitere Informationen finden Sie in der IAM-Dokumentation.

ListPhraseSets

rpc ListPhraseSets(ListPhraseSetsRequest) returns (ListPhraseSetsResponse)

Listet PhraseSets auf.

Autorisierungsbereiche

Erfordert den folgenden OAuth-Bereich:

  • https://www.googleapis.com/auth/cloud-platform

Weitere Informationen finden Sie unter Authentication Overview.

IAM-Berechtigungen

Erfordert die folgende IAM-Berechtigung für die Ressource parent:

  • speech.phraseSets.list

Weitere Informationen finden Sie in der IAM-Dokumentation.

ListRecognizers

rpc ListRecognizers(ListRecognizersRequest) returns (ListRecognizersResponse)

Listet Erkennungssysteme auf.

Autorisierungsbereiche

Erfordert den folgenden OAuth-Bereich:

  • https://www.googleapis.com/auth/cloud-platform

Weitere Informationen finden Sie unter Authentication Overview.

IAM-Berechtigungen

Erfordert die folgende IAM-Berechtigung für die Ressource parent:

  • speech.recognizers.list

Weitere Informationen finden Sie in der IAM-Dokumentation.

Erkennen

rpc Recognize(RecognizeRequest) returns (RecognizeResponse)

Führt synchrone Spracherkennung durch: Die Ergebnisse erhalten Sie, wenn alle Audiodaten gesendet und verarbeitet wurden.

Autorisierungsbereiche

Erfordert den folgenden OAuth-Bereich:

  • https://www.googleapis.com/auth/cloud-platform

Weitere Informationen finden Sie unter Authentication Overview.

IAM-Berechtigungen

Erfordert die folgende IAM-Berechtigung für die Ressource recognizer:

  • speech.recognizers.recognize

Weitere Informationen finden Sie in der IAM-Dokumentation.

StreamingRecognize

rpc StreamingRecognize(StreamingRecognizeRequest) returns (StreamingRecognizeResponse)

Führt bidirektionale Streamingspracherkennung durch: Die Ergebnisse erhalten Sie, während die Audiodaten gesendet werden. Diese Methode ist nur über die gRPC API (nicht über die REST API) verfügbar.

Autorisierungsbereiche

Erfordert den folgenden OAuth-Bereich:

  • https://www.googleapis.com/auth/cloud-platform

Weitere Informationen finden Sie unter Authentication Overview.

IAM-Berechtigungen

Erfordert die folgende IAM-Berechtigung für die Ressource recognizer:

  • speech.recognizers.recognize

Weitere Informationen finden Sie in der IAM-Dokumentation.

UndeleteCustomClass

rpc UndeleteCustomClass(UndeleteCustomClassRequest) returns (Operation)

Macht das Löschen von CustomClass rückgängig.

Autorisierungsbereiche

Erfordert den folgenden OAuth-Bereich:

  • https://www.googleapis.com/auth/cloud-platform

Weitere Informationen finden Sie unter Authentication Overview.

IAM-Berechtigungen

Erfordert die folgende IAM-Berechtigung für die Ressource name:

  • speech.customClasses.undelete

Weitere Informationen finden Sie in der IAM-Dokumentation.

UndeletePhraseSet

rpc UndeletePhraseSet(UndeletePhraseSetRequest) returns (Operation)

Macht das Löschen von PhraseSet rückgängig.

Autorisierungsbereiche

Erfordert den folgenden OAuth-Bereich:

  • https://www.googleapis.com/auth/cloud-platform

Weitere Informationen finden Sie unter Authentication Overview.

IAM-Berechtigungen

Erfordert die folgende IAM-Berechtigung für die Ressource name:

  • speech.phraseSets.undelete

Weitere Informationen finden Sie in der IAM-Dokumentation.

UndeleteRecognizer

rpc UndeleteRecognizer(UndeleteRecognizerRequest) returns (Operation)

Macht das Löschen von Recognizer rückgängig.

Autorisierungsbereiche

Erfordert den folgenden OAuth-Bereich:

  • https://www.googleapis.com/auth/cloud-platform

Weitere Informationen finden Sie unter Authentication Overview.

IAM-Berechtigungen

Erfordert die folgende IAM-Berechtigung für die Ressource name:

  • speech.recognizers.undelete

Weitere Informationen finden Sie in der IAM-Dokumentation.

UpdateConfig

rpc UpdateConfig(UpdateConfigRequest) returns (Config)

Aktualisiert den Config.

Autorisierungsbereiche

Erfordert den folgenden OAuth-Bereich:

  • https://www.googleapis.com/auth/cloud-platform

Weitere Informationen finden Sie unter Authentication Overview.

IAM-Berechtigungen

Erfordert die folgende IAM-Berechtigung für die Ressource name:

  • speech.config.update

Weitere Informationen finden Sie in der IAM-Dokumentation.

UpdateCustomClass

rpc UpdateCustomClass(UpdateCustomClassRequest) returns (Operation)

Aktualisiert den CustomClass.

Autorisierungsbereiche

Erfordert den folgenden OAuth-Bereich:

  • https://www.googleapis.com/auth/cloud-platform

Weitere Informationen finden Sie unter Authentication Overview.

IAM-Berechtigungen

Erfordert die folgende IAM-Berechtigung für die Ressource name:

  • speech.customClasses.update

Weitere Informationen finden Sie in der IAM-Dokumentation.

UpdatePhraseSet

rpc UpdatePhraseSet(UpdatePhraseSetRequest) returns (Operation)

Aktualisiert den PhraseSet.

Autorisierungsbereiche

Erfordert den folgenden OAuth-Bereich:

  • https://www.googleapis.com/auth/cloud-platform

Weitere Informationen finden Sie unter Authentication Overview.

IAM-Berechtigungen

Erfordert die folgende IAM-Berechtigung für die Ressource name:

  • speech.phraseSets.update

Weitere Informationen finden Sie in der IAM-Dokumentation.

UpdateRecognizer

rpc UpdateRecognizer(UpdateRecognizerRequest) returns (Operation)

Aktualisiert den Recognizer.

Autorisierungsbereiche

Erfordert den folgenden OAuth-Bereich:

  • https://www.googleapis.com/auth/cloud-platform

Weitere Informationen finden Sie unter Authentication Overview.

IAM-Berechtigungen

Erfordert die folgende IAM-Berechtigung für die Ressource name:

  • speech.recognizers.update

Weitere Informationen finden Sie in der IAM-Dokumentation.

AccessMetadata

Die Zugriffsmetadaten für eine bestimmte Region. Dies kann angewendet werden, wenn die Organisationsrichtlinie für das jeweilige Projekt eine bestimmte Region nicht zulässt.

Felder
constraint_type

ConstraintType

Beschreibt die verschiedenen Arten von Einschränkungen, die angewendet werden.

ConstraintType

Beschreibt die verschiedenen Arten von Einschränkungen, die auf eine Region angewendet werden können.

Enums
CONSTRAINT_TYPE_UNSPECIFIED Nicht angegebene Einschränkung angewendet.
RESOURCE_LOCATIONS_ORG_POLICY_CREATE_CONSTRAINT Die Organisationsrichtlinie des Projekts lässt die angegebene Region nicht zu.

AutoDetectDecodingConfig

Dieser Typ hat keine Felder.

Automatisch erkannte Decodierungsparameter. Unterstützt für die folgenden Codierungen:

  • WAV_LINEAR16: 16-Bit-Little-Endian-PCM-Samples mit Vorzeichen in einem WAV-Container.

  • WAV_MULAW: 8-Bit-kompandierte Mulaw-Samples in einem WAV-Container.

  • WAV_ALAW: 8-Bit-kompandierte A-Law-Samples in einem WAV-Container.

  • RFC4867_5_AMR: AMR-Frames mit einem rfc4867.5-Header.

  • RFC4867_5_AMRWB: AMR-WB-Frames mit einem rfc4867.5-Header.

  • FLAC: FLAC-Frames im Containerformat „Natives FLAC“.

  • MP3: MPEG-Audio-Frames mit optionalen (ignorierten) ID3-Metadaten.

  • OGG_OPUS: Opus-Audioframes in einem Ogg-Container.

  • WEBM_OPUS: Opus-Audioframes in einem WebM-Container.

  • MP4_AAC: AAC-Audioframes in einem MP4-Container.

  • M4A_AAC: AAC-Audioframes in einem M4A-Container.

  • MOV_AAC: AAC-Audioframes in einem MOV-Container.

BatchRecognizeFileMetadata

Metadaten zu einer einzelnen Datei in einem Batch für BatchRecognize.

Felder
config

RecognitionConfig

Funktionen und Audiometadaten, die für die automatische Spracherkennung verwendet werden sollen. Dieses Feld kann in Kombination mit dem Feld config_mask verwendet werden, um Teile der default_recognition_config der Recognizer-Ressource sowie die config auf Anfrageebene zu überschreiben.

config_mask

FieldMask

Die Liste der Felder in config, die die Werte in der default_recognition_config des Recognizers während dieser Erkennungsanfrage überschreiben. Wenn keine Maske bereitgestellt wird, überschreiben alle Felder mit anderen Werten als Standardwerten in config die Werte im Recognizer für diese Erkennungsanfrage. Wenn eine Maske bereitgestellt wird, überschreiben nur die in der Maske aufgeführten Felder die Konfiguration im Recognizer für diese Erkennungsanfrage. Wenn ein Platzhalter (*) angegeben wird, überschreibt config die Konfiguration im Recognizer für diese Erkennungsanfrage vollständig und ersetzt sie.

Union-Feld audio_source. Die Audioquelle, bei der es sich um einen Google Cloud Storage-URI handelt. Für audio_source ist nur einer der folgenden Werte zulässig:
uri

string

Cloud Storage-URI für die Audiodatei.

BatchRecognizeFileResult

Die endgültigen Ergebnisse für eine einzelne Datei.

Felder
error

Status

Fehler, falls einer aufgetreten ist.

metadata

RecognitionResponseMetadata

uri
(deprecated)

string

Verworfen. Verwenden Sie stattdessen cloud_storage_result.native_format_uri.

transcript
(deprecated)

BatchRecognizeResults

Verworfen. Verwenden Sie stattdessen inline_result.transcript.

Union-Feld result.

Für result ist nur einer der folgenden Werte zulässig:

cloud_storage_result

CloudStorageResult

Erkennungsergebnisse werden in Cloud Storage geschrieben. Wird nur ausgefüllt, wenn GcsOutputConfig in [RecognitionOutputConfig][google.cloud.speech.v2.RecognitionOutputConfig] festgelegt ist.

inline_result

InlineResult

Erkennungsergebnisse Wird nur ausgefüllt, wenn InlineOutputConfig in [RecognitionOutputConfig][google.cloud.speech.v2.RecognitionOutputConfig] festgelegt ist.

BatchRecognizeMetadata

Vorgangsmetadaten für BatchRecognize.

Felder
transcription_metadata

map<string, BatchRecognizeTranscriptionMetadata>

Ordnen Sie den bereitgestellten Dateinamen den Transkriptionsmetadaten für diese Datei zu.

BatchRecognizeRequest

Anfragenachricht für die Methode BatchRecognize.

Felder
recognizer

string

Erforderlich. Der Name des Recognizer, der während der Erkennung verwendet werden soll. Das erwartete Format ist projects/{project}/locations/{location}/recognizers/{recognizer}. Das Segment {recognizer} kann auf _ gesetzt werden, um eine leere implizite Erkennung zu verwenden.

config

RecognitionConfig

Funktionen und Audiometadaten, die für die automatische Spracherkennung verwendet werden sollen. Mit diesem Feld in Kombination mit dem Feld config_mask können Teile des default_recognition_config der Recognizer-Ressource überschrieben werden.

config_mask

FieldMask

Die Liste der Felder in config, die die Werte in der default_recognition_config des Recognizers während dieser Erkennungsanfrage überschreiben. Wenn keine Maske bereitgestellt wird, überschreiben alle angegebenen Felder in config die Werte im Recognizer für diese Erkennungsanfrage. Wenn eine Maske bereitgestellt wird, überschreiben nur die in der Maske aufgeführten Felder die Konfiguration im Recognizer für diese Erkennungsanfrage. Wenn ein Platzhalter (*) angegeben wird, überschreibt config die Konfiguration im Recognizer für diese Erkennungsanfrage vollständig und ersetzt sie.

files[]

BatchRecognizeFileMetadata

Audiodateien mit Dateimetadaten für die automatische Spracherkennung. Es dürfen maximal 15 Dateien angegeben werden.

recognition_output_config

RecognitionOutputConfig

Konfigurationsoptionen für den Speicherort der Transkripte der einzelnen Dateien.

processing_strategy

ProcessingStrategy

Die für diese Anfrage zu verwendende Verarbeitungsstrategie.

ProcessingStrategy

Mögliche Verarbeitungsstrategien für Batchanfragen.

Enums
PROCESSING_STRATEGY_UNSPECIFIED Standardwert für die Verarbeitungsstrategie. Die Anfrage wird sofort nach Eingang bearbeitet.
DYNAMIC_BATCHING Wenn diese Option ausgewählt ist, wird die Anfrage in Zeiten geringerer Auslastung verarbeitet, um einen Preisnachlass zu erhalten. Die Anfrage wird innerhalb von 24 Stunden bearbeitet.

BatchRecognizeResponse

Antwortnachricht für BatchRecognize, die in einem Vorgang mit langer Laufzeit Operation verpackt ist.

Felder
results

map<string, BatchRecognizeFileResult>

Ordnet den Dateinamen dem Endergebnis für diese Datei zu.

total_billed_duration

Duration

Wenn verfügbar, die abgerechneten Audiosekunden für die entsprechende Anfrage.

BatchRecognizeResults

Ausgabetyp für Cloud Storage von BatchRecognize-Transkripten. Dieses Proto wird zwar nirgends in dieser API zurückgegeben, die Cloud Storage-Transkripte werden jedoch als serialisiertes Proto zurückgegeben und sollten entsprechend geparst werden.

Felder
results[]

SpeechRecognitionResult

Sequenzielle Liste der Transkriptionsergebnisse, die den sequenziellen Teilen einer Audiodatei entsprechen.

metadata

RecognitionResponseMetadata

Metadaten zur Erkennung.

BatchRecognizeTranscriptionMetadata

Metadaten zur Transkription für eine einzelne Datei, z. B. der Fortschritt in Prozent.

Felder
progress_percent

int32

Wie viel von der Datei bisher transkribiert wurde.

error

Status

Fehler, falls einer aufgetreten ist.

uri

string

Der Cloud Storage-URI, in den die Erkennungsergebnisse geschrieben werden.

CloudStorageResult

Die Endergebnisse werden in Cloud Storage geschrieben.

Felder
uri

string

Der Cloud Storage-URI, in den die Erkennungsergebnisse geschrieben wurden.

vtt_format_uri

string

Der Cloud Storage-URI, in den die Erkennungsergebnisse als VTT-formatierte Untertitel geschrieben wurden. Dieses Feld wird nur ausgefüllt, wenn die VTT-Ausgabe angefordert wird.

srt_format_uri

string

Der Cloud Storage-URI, in den die Erkennungsergebnisse als SRT-formatierte Untertitel geschrieben wurden. Dieses Feld wird nur ausgefüllt, wenn die SRT-Ausgabe angefordert wird.

Konfiguration

Nachricht, die die Konfiguration für die Speech-to-Text API darstellt. Dazu gehört ein optionaler KMS-Schlüssel, mit dem eingehende Daten verschlüsselt werden.

Felder
name

string

Nur Ausgabe. ID. Der Name der Konfigurationsressource. Es gibt genau eine Konfigurationsressource pro Projekt und Standort. Das erwartete Format ist projects/{project}/locations/{location}/config.

kms_key_name

string

Optional. Ein optionaler KMS-Schlüsselname, der, falls vorhanden, zum Verschlüsseln von Speech-to-Text-Ressourcen im Ruhezustand verwendet wird. Wenn Sie diesen Schlüssel aktualisieren, werden vorhandene Ressourcen nicht mit diesem Schlüssel verschlüsselt. Nur neue Ressourcen werden mit diesem Schlüssel verschlüsselt. Das erwartete Format ist projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

update_time

Timestamp

Nur Ausgabe. Der Zeitpunkt der letzten Änderung an dieser Ressource.

CreateCustomClassRequest

Anfragenachricht für die Methode CreateCustomClass.

Felder
custom_class

CustomClass

Erforderlich. Die zu erstellende CustomClass.

validate_only

bool

Wenn festgelegt, wird die Anfrage validiert und eine Vorschau der CustomClass angezeigt, sie wird aber nicht erstellt.

custom_class_id

string

Die für die CustomClass zu verwendende ID, die als letzte Komponente des Ressourcennamens der CustomClass verwendet wird.

Dieser Wert sollte 4 bis 63 Zeichen umfassen. Gültige Zeichen sind /[az][0-9]-/.

parent

string

Erforderlich. Das Projekt und der Standort, an dem diese CustomClass erstellt wird. Das erwartete Format ist projects/{project}/locations/{location}.

CreatePhraseSetRequest

Anfragenachricht für die Methode CreatePhraseSet.

Felder
phrase_set

PhraseSet

Erforderlich. Das zu erstellende PhraseSet.

validate_only

bool

Wenn festgelegt, wird die Anfrage validiert und eine Vorschau des PhraseSets angezeigt, es wird aber nicht erstellt.

phrase_set_id

string

Die für das PhraseSet zu verwendende ID, die als letzte Komponente des Ressourcennamens des PhraseSets verwendet wird.

Dieser Wert sollte 4 bis 63 Zeichen umfassen. Gültige Zeichen sind /[az][0-9]-/.

parent

string

Erforderlich. Das Projekt und der Standort, an dem dieses PhraseSet erstellt wird. Das erwartete Format ist projects/{project}/locations/{location}.

CreateRecognizerRequest

Anfragenachricht für die Methode CreateRecognizer.

Felder
recognizer

Recognizer

Erforderlich. Der zu erstellende Recognizer.

validate_only

bool

Wenn festgelegt, wird die Anfrage validiert und eine Vorschau der Erkennung angezeigt, sie wird aber nicht erstellt.

recognizer_id

string

Die für den Recognizer zu verwendende ID, die die letzte Komponente des Ressourcennamens des Recognizers darstellt.

Dieser Wert sollte 4 bis 63 Zeichen umfassen. Gültige Zeichen sind /[az][0-9]-/.

parent

string

Erforderlich. Das Projekt und der Standort, an dem dieser Recognizer erstellt wird. Das erwartete Format ist projects/{project}/locations/{location}.

CustomClass

CustomClass für die Gewichtung bei der Spracherkennung. Damit definieren Sie eine Reihe von Wörtern oder Begriffen, die ein gemeinsames Konzept oder Thema darstellen, das wahrscheinlich in Ihrem Audio vorkommt, z. B. eine Liste von Namen von Passagierschiffen.

Felder
name

string

Nur Ausgabe. ID. Der Ressourcenname der CustomClass. Format: projects/{project}/locations/{location}/customClasses/{custom_class}.

uid

string

Nur Ausgabe. Vom System zugewiesene eindeutige Kennung für die CustomClass.

display_name

string

Optional. Vom Nutzer festlegbarer, für Menschen lesbarer Name für die CustomClass. Darf höchstens 63 Zeichen lang sein.

items[]

ClassItem

Eine Sammlung von Klassenelementen.

state

State

Nur Ausgabe. Der Lebenszyklusstatus der CustomClass.

create_time

Timestamp

Nur Ausgabe. Erstellungszeit.

update_time

Timestamp

Nur Ausgabe. Der Zeitpunkt der letzten Änderung an dieser Ressource.

delete_time

Timestamp

Nur Ausgabe. Der Zeitpunkt, zu dem das Löschen dieser Ressource angefordert wurde.

expire_time

Timestamp

Nur Ausgabe. Der Zeitpunkt, zu dem diese Ressource gelöscht wird.

annotations

map<string, string>

Optional. Ermöglicht Nutzern das Speichern kleiner Mengen beliebiger Daten. Sowohl der Schlüssel als auch der Wert dürfen jeweils maximal 63 Zeichen lang sein. Maximal 100 Annotationen.

etag

string

Nur Ausgabe. Diese Prüfsumme wird vom Server auf Grundlage des Werts anderer Felder berechnet. Kann bei Aktualisierungs-, Wiederherstellungs- und Löschanfragen gesendet werden, um sicherzustellen, dass der Client vor dem Fortfahren einen aktuellen Wert hat.

reconciling

bool

Nur Ausgabe. Gibt an, ob diese CustomClass gerade aktualisiert wird.

kms_key_name

string

Nur Ausgabe. Der KMS-Schlüsselname, mit dem die CustomClass verschlüsselt wird. Das erwartete Format ist projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

kms_key_version_name

string

Nur Ausgabe. Der Name der KMS-Schlüsselversion, mit der die CustomClass verschlüsselt wird. Das erwartete Format ist projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}/cryptoKeyVersions/{crypto_key_version}.

ClassItem

Ein Element der Klasse.

Felder
value

string

Der Wert des Klassenartikels.

Bundesland

Eine Reihe von Status, die den Lebenszyklus einer CustomClass definieren.

Enums
STATE_UNSPECIFIED Nicht angegebener Zustand. Dies wird nur verwendet, um nicht festgelegte Werte zu unterscheiden.
ACTIVE Der normale und der aktive Status.
DELETED Diese CustomClass wurde gelöscht.

DeleteCustomClassRequest

Anfragenachricht für die Methode DeleteCustomClass.

Felder
name

string

Erforderlich. Der Name der zu löschenden CustomClass. Format: projects/{project}/locations/{location}/customClasses/{custom_class}

validate_only

bool

Wenn festgelegt, wird die Anfrage validiert und eine Vorschau der gelöschten CustomClass angezeigt, sie wird aber nicht tatsächlich gelöscht.

allow_missing

bool

Wenn dieser Wert auf „true“ gesetzt ist und die CustomClass nicht gefunden wird, ist die Anfrage erfolgreich und es wird keine Operation aufgezeichnet.

etag

string

Diese Prüfsumme wird vom Server auf Grundlage des Werts anderer Felder berechnet. Kann bei Aktualisierungs-, Wiederherstellungs- und Löschanfragen gesendet werden, um sicherzustellen, dass der Client vor dem Fortfahren einen aktuellen Wert hat.

DeletePhraseSetRequest

Anfragenachricht für die Methode DeletePhraseSet.

Felder
name

string

Erforderlich. Der Name des zu löschenden PhraseSets. Format: projects/{project}/locations/{location}/phraseSets/{phrase_set}

validate_only

bool

Wenn festgelegt, wird die Anfrage validiert und eine Vorschau des gelöschten PhraseSet angezeigt, es wird aber nicht tatsächlich gelöscht.

allow_missing

bool

Wenn dieser Wert auf „true“ gesetzt ist und das PhraseSet nicht gefunden wird, ist die Anfrage erfolgreich und es wird nichts ausgeführt (in diesem Fall wird kein Vorgang aufgezeichnet).

etag

string

Diese Prüfsumme wird vom Server auf Grundlage des Werts anderer Felder berechnet. Kann bei Aktualisierungs-, Wiederherstellungs- und Löschanfragen gesendet werden, um sicherzustellen, dass der Client vor dem Fortfahren einen aktuellen Wert hat.

DeleteRecognizerRequest

Anfragenachricht für die Methode DeleteRecognizer.

Felder
name

string

Erforderlich. Der Name des zu löschenden Recognizers. Format: projects/{project}/locations/{location}/recognizers/{recognizer}

validate_only

bool

Wenn festgelegt, wird die Anfrage validiert und eine Vorschau des gelöschten Recognizers angezeigt, er wird aber nicht tatsächlich gelöscht.

allow_missing

bool

Wenn dieser Wert auf „true“ gesetzt ist und die Erkennung nicht gefunden wird, ist die Anfrage erfolgreich und es wird keine Aktion ausgeführt (in diesem Fall wird kein Vorgang aufgezeichnet).

etag

string

Diese Prüfsumme wird vom Server auf Grundlage des Werts anderer Felder berechnet. Kann bei Aktualisierungs-, Wiederherstellungs- und Löschanfragen gesendet werden, um sicherzustellen, dass der Client vor dem Fortfahren einen aktuellen Wert hat.

DenoiserConfig

Konfiguration der Rauschunterdrückung. Wird möglicherweise nicht für alle Modelle unterstützt und hat möglicherweise keine Auswirkungen.

Felder
denoise_audio

bool

Entfernt Rauschen aus der Audioeingabe, bevor sie an das Transkriptionsmodell gesendet wird.

snr_threshold

float

SNR-Grenzwert (Signal-to-Noise Ratio) für den Denoiser. Hier steht SNR für die Lautstärke des Sprachsignals. Audio mit einem SNR unter diesem Grenzwert, d. h. Sprache, die zu leise ist, wird nicht an das Transkriptionsmodell gesendet.

Wenn snr_threshold=0, wird keine Filterung angewendet.

ExplicitDecodingConfig

Explizit angegebene Decodierungsparameter.

Felder
encoding

AudioEncoding

Erforderlich. Codierung der Audiodaten, die zur Erkennung gesendet werden.

sample_rate_hertz

int32

Optional. Abtastrate der zur Spracherkennung gesendeten Audiodaten in Hertz. Gültige Werte sind: 8.000–48.000. Der optimale Wert ist 16.000. Stellen Sie die Abtastrate der Audioquelle auf 16.000 Hz ein, um die besten Ergebnisse zu erzielen. Falls dies nicht möglich ist, verwenden Sie die native Abtastrate der Audioquelle (anstatt eine erneute Abtastung durchzuführen). Dieses Feld ist aus Gründen der Abwärtskompatibilität als OPTIONAL gekennzeichnet. Sie ist (und war schon immer) praktisch ERFORDERLICH.

audio_channel_count

int32

Optional. Anzahl der Kanäle in den zur Spracherkennung gesendeten Audiodaten. Dieses Feld ist aus Gründen der Abwärtskompatibilität als OPTIONAL gekennzeichnet. Sie ist (und war schon immer) praktisch ERFORDERLICH.

Der maximal zulässige Wert beträgt 8.

AudioEncoding

Unterstützte Codierungen von Audiodaten.

Enums
AUDIO_ENCODING_UNSPECIFIED Standardwert Dieser Wert wird nicht verwendet.
LINEAR16 16-Bit-Little-Endian-PCM-Samples mit Vorzeichen ohne Header.
MULAW Headerlose 8-Bit-Samples mit kompandiertem Mulaw.
ALAW Headerlose 8-Bit-kompandierte A-Law-Samples.
AMR AMR-Frames mit einem rfc4867.5-Header.
AMR_WB AMR-WB-Frames mit einem rfc4867.5-Header.
FLAC FLAC-Frames im Containerformat „Native FLAC“.
MP3 MPEG-Audio-Frames mit optionalen (ignorierten) ID3-Metadaten.
OGG_OPUS Opus-Audioframes in einem Ogg-Container.
WEBM_OPUS Opus-Audioframes in einem WebM-Container.
MP4_AAC AAC-Audioframes in einem MP4-Container.
M4A_AAC AAC-Audioframes in einem M4A-Container.
MOV_AAC AAC-Audioframes in einem MOV-Container.

GcsOutputConfig

Ausgabekonfigurationen für Cloud Storage.

Felder
uri

string

Das Präfix des Cloud Storage-URI, mit dem die Erkennungsergebnisse geschrieben werden.

GetConfigRequest

Anfragenachricht für die Methode GetConfig.

Felder
name

string

Erforderlich. Der Name der abzurufenden Konfiguration. Es gibt genau eine Konfigurationsressource pro Projekt und Standort. Das erwartete Format ist projects/{project}/locations/{location}/config.

GetCustomClassRequest

Anfragenachricht für die Methode GetCustomClass.

Felder
name

string

Erforderlich. Der Name der abzurufenden CustomClass. Das erwartete Format ist projects/{project}/locations/{location}/customClasses/{custom_class}.

GetPhraseSetRequest

Anfragenachricht für die Methode GetPhraseSet.

Felder
name

string

Erforderlich. Der Name des abzurufenden PhraseSet. Das erwartete Format ist projects/{project}/locations/{location}/phraseSets/{phrase_set}.

GetRecognizerRequest

Anfragenachricht für die Methode GetRecognizer.

Felder
name

string

Erforderlich. Der Name des abzurufenden Recognizers. Das erwartete Format ist projects/{project}/locations/{location}/recognizers/{recognizer}.

InlineOutputConfig

Dieser Typ hat keine Felder.

Ausgabekonfigurationen für Inline-Antworten.

InlineResult

Die endgültigen Ergebnisse werden inline in der Erkennungsantwort zurückgegeben.

Felder
transcript

BatchRecognizeResults

Das Transkript für die Audiodatei.

vtt_captions

string

Das Transkript der Audiodatei als VTT-formatierte Untertitel. Dieses Feld wird nur ausgefüllt, wenn die VTT-Ausgabe angefordert wird.

srt_captions

string

Das Transkript der Audiodatei als SRT-formatierte Untertitel. Dieses Feld wird nur ausgefüllt, wenn die SRT-Ausgabe angefordert wird.

LanguageMetadata

Die Metadaten zu den in einer bestimmten Region verfügbaren Sprachen. Derzeit sind das nur die Modelle, die für die einzelnen Sprachen verfügbar sind.

Felder
models

map<string, ModelMetadata>

Karte der Sprache (Sprachcode) -> Modelle

ListCustomClassesRequest

Anfragenachricht für die Methode ListCustomClasses.

Felder
parent

string

Erforderlich. Das Projekt und der Standort der aufzulistenden CustomClass-Ressourcen. Das erwartete Format ist projects/{project}/locations/{location}.

page_size

int32

Anzahl der Ergebnisse pro Anfrage. Ein gültiger page_size-Wert liegt zwischen 0 und 100 (einschließlich). Wenn „page_size“ null oder nicht angegeben ist, wird eine Seitengröße von 5 ausgewählt. Wenn die Seitengröße 100 überschreitet, wird sie auf 100 reduziert. Beachten Sie, dass bei einem Aufruf möglicherweise weniger Ergebnisse als die angeforderte Seitengröße zurückgegeben werden.

page_token

string

Ein Seitentoken, das von einem vorherigen ListCustomClasses-Aufruf empfangen wurde. Geben Sie dieses an, um die nachfolgende Seite abzurufen.

Beim Paginieren müssen alle anderen für ListCustomClasses bereitgestellten Parameter mit dem Aufruf übereinstimmen, der das Seitentoken bereitgestellt hat.

show_deleted

bool

Gibt an, ob gelöschte Ressourcen angezeigt werden sollen.

ListCustomClassesResponse

Antwortnachricht für die Methode ListCustomClasses.

Felder
custom_classes[]

CustomClass

Die Liste der angeforderten CustomClasses.

next_page_token

string

Ein Token, das als page_token gesendet werden kann, um die nächste Seite abzurufen. Wenn dieses Feld weggelassen wird, gibt es keine nachfolgenden Seiten. Dieses Token läuft nach 72 Stunden ab.

ListPhraseSetsRequest

Anfragenachricht für die Methode ListPhraseSets.

Felder
parent

string

Erforderlich. Das Projekt und der Standort der aufzulistenden PhraseSet-Ressourcen. Das erwartete Format ist projects/{project}/locations/{location}.

page_size

int32

Die maximale Anzahl der zurückzugebenden PhraseSets. Der Dienst gibt möglicherweise weniger als diesen Wert zurück. Falls nicht angegeben, werden maximal 5 PhraseSets zurückgegeben. Der Höchstwert beträgt 100. Werte über 100 werden implizit auf 100 umgewandelt.

page_token

string

Ein Seitentoken, das von einem vorherigen ListPhraseSets-Aufruf empfangen wurde. Geben Sie dieses an, um die nachfolgende Seite abzurufen.

Beim Paginieren müssen alle anderen für ListPhraseSets bereitgestellten Parameter mit dem Aufruf übereinstimmen, der das Seitentoken bereitgestellt hat.

show_deleted

bool

Gibt an, ob gelöschte Ressourcen angezeigt werden sollen.

ListPhraseSetsResponse

Antwortnachricht für die Methode ListPhraseSets.

Felder
phrase_sets[]

PhraseSet

Die Liste der angeforderten PhraseSets.

next_page_token

string

Ein Token, das als page_token gesendet werden kann, um die nächste Seite abzurufen. Wenn dieses Feld weggelassen wird, gibt es keine nachfolgenden Seiten. Dieses Token läuft nach 72 Stunden ab.

ListRecognizersRequest

Anfragenachricht für die Methode ListRecognizers.

Felder
parent

string

Erforderlich. Das Projekt und der Standort der aufzulistenden Recognizers. Das erwartete Format ist projects/{project}/locations/{location}.

page_size

int32

Die maximale Anzahl der zurückzugebenden Recognizers. Der Dienst gibt möglicherweise weniger als diesen Wert zurück. Wenn nicht angegeben, werden maximal 5 Recognizer zurückgegeben. Der Höchstwert beträgt 100. Werte über 100 werden implizit auf 100 umgewandelt.

page_token

string

Ein Seitentoken, das von einem vorherigen ListRecognizers-Aufruf empfangen wurde. Geben Sie dieses an, um die nachfolgende Seite abzurufen.

Beim Paginieren müssen alle anderen für ListRecognizers bereitgestellten Parameter mit dem Aufruf übereinstimmen, der das Seitentoken bereitgestellt hat.

show_deleted

bool

Gibt an, ob gelöschte Ressourcen angezeigt werden sollen.

ListRecognizersResponse

Antwortnachricht für die Methode ListRecognizers.

Felder
recognizers[]

Recognizer

Die Liste der angeforderten Recognizers.

next_page_token

string

Ein Token, das als page_token gesendet werden kann, um die nächste Seite abzurufen. Wenn dieses Feld weggelassen wird, gibt es keine nachfolgenden Seiten. Dieses Token läuft nach 72 Stunden ab.

LocationsMetadata

Hauptmetadaten für die Locations API für STT V2. Derzeit sind das nur die Metadaten zu Sprachen, Modellen und Funktionen.

Felder
languages

LanguageMetadata

Informationen zu verfügbaren Gebietsschemas, Modellen und Funktionen, die in der hierarchischen Struktur von Gebietsschemas –> Modellen –> Funktionen dargestellt werden

access_metadata

AccessMetadata

Informationen zu den Zugriffsmetadaten für die Region und das angegebene Projekt.

ModelFeature

Stellt ein einzelnes Feature eines Modells dar. Wenn das Feature recognizer ist, entspricht der release_state des Features dem release_state des Modells.

Felder
feature

string

Der Name des Features (Hinweis: Das Feature kann recognizer sein)

release_state

string

Der Veröffentlichungsstatus der Funktion

ModelFeatures

Stellt die Sammlung von Features dar, die zu einem Modell gehören.

Felder
model_feature[]

ModelFeature

Wiederkehrendes Feld, das alle Merkmale des Modells enthält

ModelMetadata

Die Metadaten zu den Modellen in einer bestimmten Region für ein bestimmtes Gebietsschema. Derzeit sind das nur die Funktionen des Modells.

Felder
model_features

map<string, ModelFeatures>

Zuordnung von Modellname –> Funktionen des Modells

NativeOutputFileFormatConfig

Dieser Typ hat keine Felder.

Ausgabekonfigurationen für serialisierte BatchRecognizeResults-Protos.

OperationMetadata

Stellt die Metadaten eines Vorgangs mit langer Ausführungszeit dar.

Felder
create_time

Timestamp

Die Zeit, zu der der Vorgang erstellt wurde.

update_time

Timestamp

Der Zeitpunkt, zu dem der Vorgang zuletzt aktualisiert wurde.

resource

string

Der Ressourcenpfad für das Ziel des Vorgangs.

method

string

Die Methode, die den Vorgang ausgelöst hat.

kms_key_name

string

Der KMS-Schlüsselname, mit dem der Inhalt des Vorgangs verschlüsselt wird. Das erwartete Format ist projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

kms_key_version_name

string

Der Name der KMS-Schlüsselversion, mit der der Inhalt des Vorgangs verschlüsselt wird. Das erwartete Format ist projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}/cryptoKeyVersions/{crypto_key_version}.

progress_percent

int32

Der prozentuale Fortschritt des Vorgangs. Die Werte können zwischen 0 und 100 liegen. Wenn der Wert 100 ist, ist der Vorgang abgeschlossen.

Union-Feld request. Die Anfrage, die den Vorgang ausgelöst hat. Für request ist nur einer der folgenden Werte zulässig:
batch_recognize_request

BatchRecognizeRequest

Die BatchRecognizeRequest, die den Vorgang ausgelöst hat.

create_recognizer_request

CreateRecognizerRequest

Die CreateRecognizerRequest, die den Vorgang ausgelöst hat.

update_recognizer_request

UpdateRecognizerRequest

Die UpdateRecognizerRequest, die den Vorgang ausgelöst hat.

delete_recognizer_request

DeleteRecognizerRequest

Die DeleteRecognizerRequest, die den Vorgang ausgelöst hat.

undelete_recognizer_request

UndeleteRecognizerRequest

Die UndeleteRecognizerRequest, die den Vorgang ausgelöst hat.

create_custom_class_request

CreateCustomClassRequest

Die CreateCustomClassRequest, die den Vorgang ausgelöst hat.

update_custom_class_request

UpdateCustomClassRequest

Die UpdateCustomClassRequest, die den Vorgang ausgelöst hat.

delete_custom_class_request

DeleteCustomClassRequest

Die DeleteCustomClassRequest, die den Vorgang ausgelöst hat.

undelete_custom_class_request

UndeleteCustomClassRequest

Die UndeleteCustomClassRequest, die den Vorgang ausgelöst hat.

create_phrase_set_request

CreatePhraseSetRequest

Die CreatePhraseSetRequest, die den Vorgang ausgelöst hat.

update_phrase_set_request

UpdatePhraseSetRequest

Die UpdatePhraseSetRequest, die den Vorgang ausgelöst hat.

delete_phrase_set_request

DeletePhraseSetRequest

Die DeletePhraseSetRequest, die den Vorgang ausgelöst hat.

undelete_phrase_set_request

UndeletePhraseSetRequest

Die UndeletePhraseSetRequest, die den Vorgang ausgelöst hat.

update_config_request
(deprecated)

UpdateConfigRequest

Die UpdateConfigRequest, die den Vorgang ausgelöst hat.

Union-Feld metadata. Spezifische Metadaten pro RPC. Für metadata ist nur einer der folgenden Werte zulässig:
batch_recognize_metadata

BatchRecognizeMetadata

Metadaten, die für die BatchRecognize-Methode spezifisch sind.

OutputFormatConfig

Konfiguration für das Format der Ergebnisse, die in output gespeichert werden.

Felder
native

NativeOutputFileFormatConfig

Konfiguration für das native Ausgabeformat. Wenn dieses Feld festgelegt ist oder kein anderes Ausgabefeld für das Format festgelegt ist, werden Transkripte im nativen Format in die Senke geschrieben.

vtt

VttOutputFileFormatConfig

Konfiguration für das VTT-Ausgabeformat. Wenn dieses Feld festgelegt ist, werden Transkripte im VTT-Format in die Senke geschrieben.

srt

SrtOutputFileFormatConfig

Konfiguration für das SRT-Ausgabeformat. Wenn dieses Feld festgelegt ist, werden Transkripte im SRT-Format in die Senke geschrieben.

PhraseSet

PhraseSet für die Gewichtung bei der Spracherkennung. Mit einem PhraseSet werden dem Spracherkennungsmodul „Hinweise“ für bestimmte Wörter und Wortgruppen gegeben, die bei den Ergebnissen zu bevorzugen sind.

Felder
name

string

Nur Ausgabe. ID. Der Ressourcenname des PhraseSets. Format: projects/{project}/locations/{location}/phraseSets/{phrase_set}.

uid

string

Nur Ausgabe. Vom System zugewiesene eindeutige Kennung für das PhraseSet.

phrases[]

Phrase

Eine Liste mit Wörtern und Wortgruppen.

boost

float

Hinweis-Boost Ein positiver Wert erhöht die Wahrscheinlichkeit, dass eine bestimmte Wortgruppe gegenüber anderen ähnlich klingenden Wortgruppen erkannt wird. Je höher der Boost, desto höher ist auch die Wahrscheinlichkeit einer fälschlichen Erkennung. Gültige boost-Werte liegen zwischen 0 (exklusiv) und 20. Wir empfehlen, den optimalen Wert für Ihren Anwendungsfall mithilfe einer binären Suche zu ermitteln und Ihren Anfragen sowohl Begriffe mit als auch ohne Steigerung hinzuzufügen.

display_name

string

Vom Nutzer festlegbarer, für Menschen lesbarer Name für den PhraseSet. Darf höchstens 63 Zeichen lang sein.

state

State

Nur Ausgabe. Der Lebenszyklusstatus des PhraseSets.

create_time

Timestamp

Nur Ausgabe. Erstellungszeit.

update_time

Timestamp

Nur Ausgabe. Der Zeitpunkt der letzten Änderung an dieser Ressource.

delete_time

Timestamp

Nur Ausgabe. Der Zeitpunkt, zu dem das Löschen dieser Ressource angefordert wurde.

expire_time

Timestamp

Nur Ausgabe. Der Zeitpunkt, zu dem diese Ressource gelöscht wird.

annotations

map<string, string>

Ermöglicht Nutzern das Speichern kleiner Mengen beliebiger Daten. Sowohl der Schlüssel als auch der Wert dürfen jeweils maximal 63 Zeichen lang sein. Maximal 100 Annotationen.

etag

string

Nur Ausgabe. Diese Prüfsumme wird vom Server auf Grundlage des Werts anderer Felder berechnet. Kann bei Aktualisierungs-, Wiederherstellungs- und Löschanfragen gesendet werden, um sicherzustellen, dass der Client vor dem Fortfahren einen aktuellen Wert hat.

reconciling

bool

Nur Ausgabe. Gibt an, ob dieses PhraseSet gerade aktualisiert wird.

kms_key_name

string

Nur Ausgabe. Der KMS-Schlüsselname, mit dem das PhraseSet verschlüsselt wird. Das erwartete Format ist projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

kms_key_version_name

string

Nur Ausgabe. Der Name der KMS-Schlüsselversion, mit der das PhraseSet verschlüsselt wird. Das erwartete Format ist projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}/cryptoKeyVersions/{crypto_key_version}.

Wortgruppe

Ein Phrase-Objekt enthält Wörter und Wortgruppen-„Hinweise“, damit die Spracherkennung sie mit größerer Wahrscheinlichkeit erkennt. Kann zur Verbesserung der Genauigkeit für bestimmte Wörter und Wendungen verwendet werden, z. B. wenn der Nutzer bestimmte Befehle häufig spricht. Lässt sich ebenfalls verwenden, um weitere Wörter zum Vokabular des Erkennungsmoduls hinzuzufügen.

Listenelemente können auch CustomClass-Verweise enthalten, die Gruppen von Wörtern enthalten, die gängige Konzepte in natürlicher Sprache darstellen.

Felder
value

string

Die Wortgruppe selbst.

boost

float

Hinweis-Boost Überschreibt die Optimierung, die auf Wortgruppensatzebene festgelegt ist. Ein positiver Wert erhöht die Wahrscheinlichkeit, dass eine bestimmte Wortgruppe gegenüber anderen ähnlich klingenden Wortgruppen erkannt wird. Je höher der Boost, desto höher ist auch die Wahrscheinlichkeit einer fälschlichen Erkennung. Negative Boost-Werte entsprechen der Anti-Bias-Funktion. Die Funktion zur Vermeidung von Bias ist nicht aktiviert. Daher wird bei negativen Steigerungswerten ein Fehler zurückgegeben. Die Optimierungswerte müssen zwischen 0 und 20 liegen. Bei Werten außerhalb dieses Bereichs wird ein Fehler zurückgegeben. Wir empfehlen, den optimalen Wert für Ihren Anwendungsfall mithilfe einer binären Suche zu ermitteln und Ihren Anfragen sowohl Begriffe mit als auch ohne Steigerung hinzuzufügen.

Bundesland

Eine Reihe von Status, die den Lebenszyklus eines PhraseSet definieren.

Enums
STATE_UNSPECIFIED Nicht angegebener Zustand. Dies wird nur verwendet, um nicht festgelegte Werte zu unterscheiden.
ACTIVE Der normale und der aktive Status.
DELETED Dieses PhraseSet wurde gelöscht.

RecognitionConfig

Stellt dem Erkennungsmodul Informationen zur Verarbeitung der Erkennungsanfrage zur Verfügung.

Felder
model

string

Optional. Welches Modell für Erkennungsanfragen verwendet werden soll. Wählen Sie das für Ihre Domain am besten geeignete Modell aus, um die besten Ergebnisse zu erzielen.

Eine Anleitung zur Auswahl des zu verwendenden Modells finden Sie in der Dokumentation zu Transkriptionsmodellen. Die in den einzelnen Regionen unterstützten Modelle finden Sie in der Tabelle der unterstützten Modelle.

language_codes[]

string

Optional. Die Sprache der übermittelten Audiodaten, angegeben als BCP-47-Sprachcode. Sprachtags werden vor der Verwendung normalisiert, z. B. wird „en-us“ zu „en-US“.

Die unterstützten Sprachen für die einzelnen Modelle sind in der Tabelle der unterstützten Modelle aufgeführt.

Wenn zusätzliche Sprachen angegeben werden, enthält das Erkennungsergebnis die Erkennung in der wahrscheinlichsten erkannten Sprache. Das Erkennungsergebnis enthält den Sprachcode der Sprache, die in dem Audio erkannt wird.

features

RecognitionFeatures

Spracherkennungsfunktionen, die aktiviert werden müssen.

adaptation

SpeechAdaptation

Kontext für die Sprachanpassung, der die Vorhersagen des Erkennungsmoduls für bestimmte Wörter und Wortgruppen gewichtet.

transcript_normalization

TranscriptNormalization

Optional. Mit der Transkriptnormalisierung können Sie automatisch bestimmte Teile des Transkripts durch von Ihnen ausgewählte Formulierungen ersetzen lassen. Bei StreamingRecognize gilt diese Normalisierung nur für stabile Teiltranskripte (Stabilität > 0, 8) und endgültige Transkripte.

translation_config

TranslationConfig

Optional. Optionale Konfiguration, die verwendet wird, um die Übersetzung des angegebenen Audios in die gewünschte Sprache für unterstützte Modelle automatisch auszuführen.

denoiser_config

DenoiserConfig

Optional. Optionale Konfiguration der Rauschunterdrückung. Wird möglicherweise nicht für alle Modelle unterstützt und hat möglicherweise keine Auswirkungen.

Union-Feld decoding_config. Parameter für die Dekodierung von Audio, das zur Erkennung gesendet wird. Für decoding_config ist nur einer der folgenden Werte zulässig:
auto_decoding_config

AutoDetectDecodingConfig

Decodierungsparameter automatisch erkennen. Bevorzugt für unterstützte Formate.

explicit_decoding_config

ExplicitDecodingConfig

Explizit angegebene Decodierungsparameter. Erforderlich bei Verwendung von Header ohne PCM-Audio (linear16, mulaw, alaw).

RecognitionFeatures

Verfügbare Erkennungsfunktionen.

Felder
profanity_filter

bool

Wenn der Wert auf true gesetzt ist, versucht der Server, vulgäre Sprache herauszufiltern, und ersetzt in den gefilterten Wörtern alle Buchstaben mit Ausnahme des Anfangsbuchstabens durch Sternchen, z. B. „S******“. Wenn diese Option auf false gesetzt oder weggelassen wird, werden Obszönitäten nicht herausgefiltert.

enable_word_time_offsets

bool

Bei true enthält das beste Ergebnis eine Liste von Wörtern sowie die Zeitverschiebungen (Zeitstempel) zu den Anfangs- und Endzeiten dieser Wörter. Bei false werden keine Informationen zum zeitlichen Versatz auf Wortebene zurückgegeben. Der Standardwert ist false.

enable_word_confidence

bool

Bei true enthält das beste Ergebnis eine Liste von Wörtern sowie den Konfidenzwert für diese Wörter. Bei false werden keine Konfidenzinformationen auf Wortebene zurückgegeben. Der Standardwert ist false.

enable_automatic_punctuation

bool

Wenn true, werden den Hypothesen für das Erkennungsergebnis Satzzeichen hinzugefügt. Diese Funktion steht nur für ausgewählte Sprachen zur Verfügung. Mit dem Standardwert false werden den Hypothesen für das Ergebnis keine Satzzeichen hinzugefügt.

enable_spoken_punctuation

bool

Das Verhalten der gesprochenen Satzzeichen für den Anruf. Wenn true, wird das gesprochene Satzzeichen in der Anfrage durch die entsprechenden Symbole ersetzt. Beispiel: „Wie geht es dir Fragezeichen“ wird zu „Wie geht es dir?“. Weitere Informationen finden Sie unter https://cloud.google.com/speech-to-text/docs/spoken-punctuation. Bei false werden gesprochene Satzzeichen nicht ersetzt.

enable_spoken_emojis

bool

Das Verhalten der gesprochenen Emojis für den Anruf. Wenn true, wird für die Anfrage die Formatierung von gesprochenen Emojis hinzugefügt. Dadurch werden gesprochene Emojis im endgültigen Transkript durch die entsprechenden Unicode-Symbole ersetzt. Wenn false, werden gesprochene Emojis nicht ersetzt.

multi_channel_mode

MultiChannelMode

Modus für die Erkennung von Mehrkanalaudio.

diarization_config

SpeakerDiarizationConfig

Konfiguration zum Aktivieren der Sprecherbestimmung. Wenn Sie die Sprecherbestimmung aktivieren möchten, legen Sie dieses Feld auf eine leere SpeakerDiarizationConfig-Nachricht fest.

max_alternatives

int32

Maximale Anzahl der zurückzugebenden Erkennungshypothesen. Der Server gibt möglicherweise weniger als max_alternatives zurück. Gültige Werte sind 030. Bei einem Wert von 0 oder 1 wird maximal ein Ergebnis zurückgegeben. Bei Auslassung wird ein Maximum von 1 zurückgegeben.

MultiChannelMode

Optionen für die Erkennung von Mehrkanal-Audio.

Enums
MULTI_CHANNEL_MODE_UNSPECIFIED Standardwert für den Multi-Channel-Modus. Wenn der Audioinhalt mehrere Kanäle enthält, wird nur der erste Kanal transkribiert. Die anderen Kanäle werden ignoriert.
SEPARATE_RECOGNITION_PER_CHANNEL Wenn diese Option ausgewählt ist, wird jeder Kanal im bereitgestellten Audio unabhängig transkribiert. Diese Option kann nicht ausgewählt werden, wenn die ausgewählte model gleich latest_short ist.

RecognitionOutputConfig

Konfigurationsoptionen für die Ausgabe(n) der Erkennung.

Felder
output_format_config

OutputFormatConfig

Optional. Konfiguration für das Format der Ergebnisse, die in output gespeichert werden. Wenn nicht angegeben, werden Transkripte nur im Format NATIVE geschrieben.

Union-Feld output.

Für output ist nur einer der folgenden Werte zulässig:

gcs_output_config

GcsOutputConfig

Wenn diese Meldung angezeigt wird, werden die Erkennungsergebnisse in den angegebenen Google Cloud Storage-URI geschrieben.

inline_response_config

InlineOutputConfig

Wenn diese Meldung ausgefüllt ist, werden die Erkennungsergebnisse nach Abschluss des Vorgangs in der Meldung BatchRecognizeResponse des Vorgangs bereitgestellt. Dies wird nur unterstützt, wenn BatchRecognize mit nur einer Audiodatei aufgerufen wird.

RecognitionResponseMetadata

Metadaten zur Erkennungsanfrage und ‑antwort.

Felder
request_id

string

Globale Anfrage-ID, die automatisch von der API generiert wird.

total_billed_duration

Duration

Wenn verfügbar, die abgerechneten Audiosekunden für die entsprechende Anfrage.

RecognizeRequest

Anfragenachricht für die Methode Recognize. Es muss entweder content oder uri angegeben werden. Wenn Sie beide oder keine Werte angeben, wird INVALID_ARGUMENT zurückgegeben. Weitere Informationen

Felder
recognizer

string

Erforderlich. Der Name des Recognizer, der während der Erkennung verwendet werden soll. Das erwartete Format ist projects/{project}/locations/{location}/recognizers/{recognizer}. Das Segment {recognizer} kann auf _ gesetzt werden, um eine leere implizite Erkennung zu verwenden.

config

RecognitionConfig

Funktionen und Audiometadaten, die für die automatische Spracherkennung verwendet werden sollen. Mit diesem Feld in Kombination mit dem Feld config_mask können Teile des default_recognition_config der Recognizer-Ressource überschrieben werden.

config_mask

FieldMask

Die Liste der Felder in config, die die Werte in der default_recognition_config des Recognizers während dieser Erkennungsanfrage überschreiben. Wenn keine Maske bereitgestellt wird, überschreiben alle Felder mit anderen Werten als Standardwerten in config die Werte im Recognizer für diese Erkennungsanfrage. Wenn eine Maske bereitgestellt wird, überschreiben nur die in der Maske aufgeführten Felder die Konfiguration im Recognizer für diese Erkennungsanfrage. Wenn ein Platzhalter (*) angegeben wird, überschreibt config die Konfiguration im Recognizer für diese Erkennungsanfrage vollständig und ersetzt sie.

Union-Feld audio_source. Die Audioquelle, bei der es sich um Inline-Content oder einen Google Cloud Storage-URI handelt. Für audio_source ist nur einer der folgenden Werte zulässig:
content

bytes

Die in RecognitionConfig angegebenen Audiodatenbyte. Wie bei allen „bytes“-Feldern verwenden auch Protokollpuffer eine reine Binärdarstellung, während JSON-Darstellungen Base64 verwenden.

uri

string

URI, der auf eine Datei verweist, die Audiodatenbyte enthält, wie in RecognitionConfig angegeben. Die Datei darf nicht komprimiert sein (z. B. gzip). Derzeit werden nur Google Cloud Storage-URIs unterstützt, die im folgenden Format angegeben werden müssen: gs://bucket_name/object_name (andere URI-Formate geben INVALID_ARGUMENT zurück). Weitere Informationen finden Sie unter Anforderungs-URIs.

RecognizeResponse

Antwortnachricht für die Methode Recognize.

Felder
results[]

SpeechRecognitionResult

Sequenzielle Liste der Transkriptionsergebnisse, die den sequenziellen Teilen einer Audiodatei entsprechen.

metadata

RecognitionResponseMetadata

Metadaten zur Erkennung.

Erkennungssystem

Eine Nachricht vom Erkennungssystem. Speichert die Erkennungskonfiguration und ‑metadaten.

Felder
name

string

Nur Ausgabe. ID. Der Ressourcenname des Recognizer. Format: projects/{project}/locations/{location}/recognizers/{recognizer}.

uid

string

Nur Ausgabe. Vom System zugewiesene eindeutige Kennung für den Recognizer.

display_name

string

Vom Nutzer festlegbarer, für Menschen lesbarer Name für den Recognizer. Darf höchstens 63 Zeichen lang sein.

model
(deprecated)

string

Optional. Dieses Feld wurde eingestellt. Das Feld model in der Nachricht RecognitionConfig wird bevorzugt.

Welches Modell für Erkennungsanfragen verwendet werden soll. Wählen Sie das für Ihre Domain am besten geeignete Modell aus, um die besten Ergebnisse zu erzielen.

Eine Anleitung zur Auswahl des zu verwendenden Modells finden Sie in der Dokumentation zu Transkriptionsmodellen. Die in den einzelnen Regionen unterstützten Modelle finden Sie in der Tabelle der unterstützten Modelle.

language_codes[]
(deprecated)

string

Optional. Dieses Feld wurde eingestellt. Das Feld language_codes in der Nachricht RecognitionConfig wird bevorzugt.

Die Sprache der übermittelten Audiodaten, angegeben als BCP-47-Sprachcode.

Die unterstützten Sprachen für die einzelnen Modelle sind in der Tabelle der unterstützten Modelle aufgeführt.

Wenn zusätzliche Sprachen angegeben werden, enthält das Erkennungsergebnis die Erkennung in der wahrscheinlichsten erkannten Sprache. Das Erkennungsergebnis enthält den Sprachcode der Sprache, die in dem Audio erkannt wird. Wenn Sie einen Recognizer erstellen oder aktualisieren, werden diese Werte in normalisierter BCP-47-Form gespeichert. Beispiel: „en-us“ wird als „en-US“ gespeichert.

default_recognition_config

RecognitionConfig

Standardkonfiguration für Anfragen mit diesem Recognizer. Dies kann durch die Inline-Konfiguration im Feld RecognizeRequest.config überschrieben werden.

annotations

map<string, string>

Ermöglicht Nutzern das Speichern kleiner Mengen beliebiger Daten. Sowohl der Schlüssel als auch der Wert dürfen jeweils maximal 63 Zeichen lang sein. Maximal 100 Annotationen.

state

State

Nur Ausgabe. Der Lebenszyklusstatus des Erkennungssystems.

create_time

Timestamp

Nur Ausgabe. Erstellungszeit.

update_time

Timestamp

Nur Ausgabe. Der Zeitpunkt der letzten Änderung dieses Recognizers.

delete_time

Timestamp

Nur Ausgabe. Der Zeitpunkt, zu dem das Löschen dieses Recognizers angefordert wurde.

expire_time

Timestamp

Nur Ausgabe. Der Zeitpunkt, zu dem dieser Recognizer gelöscht wird.

etag

string

Nur Ausgabe. Diese Prüfsumme wird vom Server auf Grundlage des Werts anderer Felder berechnet. Kann bei Aktualisierungs-, Wiederherstellungs- und Löschanfragen gesendet werden, um sicherzustellen, dass der Client vor dem Fortfahren einen aktuellen Wert hat.

reconciling

bool

Nur Ausgabe. Gibt an, ob dieser Recognizer gerade aktualisiert wird.

kms_key_name

string

Nur Ausgabe. Der KMS-Schlüsselname, mit dem der Recognizer verschlüsselt wird. Das erwartete Format ist projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}.

kms_key_version_name

string

Nur Ausgabe. Der Name der KMS-Schlüsselversion, mit der der Recognizer verschlüsselt wird. Das erwartete Format ist projects/{project}/locations/{location}/keyRings/{key_ring}/cryptoKeys/{crypto_key}/cryptoKeyVersions/{crypto_key_version}.

Bundesland

Eine Reihe von Status, die den Lebenszyklus eines Recognizer definieren.

Enums
STATE_UNSPECIFIED Der Standardwert. Dieser Wert wird verwendet, wenn der Bundesstaat weggelassen wird.
ACTIVE Der Recognizer ist aktiv und einsatzbereit.
DELETED Dieser Recognizer wurde gelöscht.

SpeakerDiarizationConfig

Konfiguration zum Aktivieren der Sprecherbestimmung.

Felder
min_speaker_count

int32

Optional. Das System bestimmt automatisch die Anzahl der Lautsprecher. Dieser Wert wird derzeit nicht verwendet.

max_speaker_count

int32

Optional. Das System bestimmt automatisch die Anzahl der Lautsprecher. Dieser Wert wird derzeit nicht verwendet.

SpeechAdaptation

Liefert dem Spracherkennungsmodul "Hinweise" für bestimmte Wörter und Wendungen, die bei den Ergebnissen zu bevorzugen sind. PhraseSets können als Inline-Ressource oder als Verweis auf eine vorhandene PhraseSet-Ressource angegeben werden.

Felder
phrase_sets[]

AdaptationPhraseSet

Eine Liste mit Inline- oder referenzierten PhraseSets.

custom_classes[]

CustomClass

Eine Liste mit Inline-CustomClasses. Auf vorhandene CustomClass-Ressourcen kann direkt in einem PhraseSet verwiesen werden.

AdaptationPhraseSet

Ein PhraseSet für die Bias-Einstellung, das entweder ein String ist, der auf den Namen einer vorhandenen PhraseSets-Ressource verweist, oder eine Inline-Definition eines PhraseSet.

Felder

Union-Feld value.

Für value ist nur einer der folgenden Werte zulässig:

phrase_set

string

Der Name einer vorhandenen PhraseSet-Ressource. Der Nutzer muss Lesezugriff auf die Ressource haben und sie darf nicht gelöscht werden.

inline_phrase_set

PhraseSet

Ein inline definiertes PhraseSet.

SpeechRecognitionAlternative

Alternative Hypothesen.

Felder
transcript

string

Transkriptionstext mit den vom Nutzer gesprochenen Wörtern

confidence

float

Eine Konfidenzschätzung zwischen 0,0 und 1,0. Je höher der Wert ist, desto höher ist die geschätzte Wahrscheinlichkeit, dass die Wörter korrekt erkannt wurden. Dieses Feld wird nur für die beste Alternative eines Nicht-Streaming-Ergebnisses oder eines Streaming-Ergebnisses festgelegt, bei dem is_final auf true gesetzt ist. Die Genauigkeit dieses Feldes kann nicht garantiert werden und Nutzer sollten sich nicht darauf verlassen, dass es immer zur Verfügung steht. Der Standardwert 0,0 ist ein Sentinel-Wert, der angibt, dass confidence nicht festgelegt wurde.

words[]

WordInfo

Eine Liste von wortspezifischen Informationen zu jedem erkannten Wort. Wenn SpeakerDiarizationConfig festgelegt ist, werden alle Wörter vom Anfang des Audios angezeigt.

SpeechRecognitionResult

Ein Spracherkennungsergebnis, das einem Teil der Audiodaten entspricht.

Felder
alternatives[]

SpeechRecognitionAlternative

Kann eine oder mehrere Erkennungshypothesen enthalten. Die Alternativen sind nach Genauigkeit geordnet. Die beste (erste) Alternative ist dabei der Einstufung des Erkennungsmoduls zufolge die wahrscheinlichste.

channel_tag

int32

Bei Mehrkanalaudio ist dies die Kanalnummer, die dem erkannten Ergebnis für die Audiodaten aus diesem Kanal entspricht. Bei audio_channel_count = N können die Ausgabewerte zwischen 1 und N liegen.

result_end_offset

Duration

Zeitverschiebung des Endes dieses Ergebnisses relativ zum Beginn des Audios.

language_code

string

Nur Ausgabe. Der Sprachcode BCP-47 der Sprache in diesem Ergebnis. Es wurde erkannt, dass dieser Sprachcode wahrscheinlich in der Audiodatei gesprochen wird.

SrtOutputFileFormatConfig

Dieser Typ hat keine Felder.

Ausgabekonfigurationen SubRip Text formatierte Untertiteldatei.

StreamingRecognitionConfig

Stellt Konfigurationsinformationen für die StreamingRecognize-Anfrage bereit.

Felder
config

RecognitionConfig

Erforderlich. Funktionen und Audiometadaten, die für die automatische Spracherkennung verwendet werden sollen. Mit diesem Feld in Kombination mit dem Feld config_mask können Teile des default_recognition_config der Recognizer-Ressource überschrieben werden.

config_mask

FieldMask

Die Liste der Felder in config, die die Werte in der default_recognition_config des Recognizers während dieser Erkennungsanfrage überschreiben. Wenn keine Maske bereitgestellt wird, überschreiben alle Felder mit anderen Werten als Standardwerten in config die Werte im Recognizer für diese Erkennungsanfrage. Wenn eine Maske bereit gestellt wird, überschreiben die in der Maske aufgeführten Felder die Konfiguration im Recognizer für diese Erkennungsanfrage. Wenn ein Platzhalter (*) angegeben wird, überschreibt config die Konfiguration im Recognizer für diese Erkennungsanfrage vollständig und ersetzt sie.

streaming_features

StreamingRecognitionFeatures

Spracherkennungsfunktionen, die für Anfragen zur Streaming-Audioerkennung aktiviert sind.

StreamingRecognitionFeatures

Verfügbare Erkennungsfunktionen speziell für Anfragen zur Streamingerkennung.

Felder
enable_voice_activity_events

bool

Wenn true, werden Antworten mit Sprachaktivitätsereignissen zurückgegeben, sobald sie erkannt werden.

interim_results

bool

Gibt an, ob Zwischenergebnisse an den Client gestreamt werden sollen. Wenn der Wert auf „true“ gesetzt ist, werden Zwischenergebnisse an den Client gestreamt. Andernfalls wird nur die endgültige Antwort zurückgegeben.

voice_activity_timeout

VoiceActivityTimeout

Wenn festgelegt, schließt der Server den Stream automatisch, nachdem die angegebene Dauer seit dem Senden des letzten VOICE_ACTIVITY-Sprachereignisses verstrichen ist. Das Feld voice_activity_events muss ebenfalls auf „true“ gesetzt sein.

VoiceActivityTimeout

Ereignisse, für die ein Zeitlimit für Sprachaktivitäten festgelegt werden kann.

Felder
speech_start_timeout

Duration

Dauer, nach der der Stream beendet wird, wenn keine Sprache erkannt wird. Wenn dieser Wert festgelegt ist und zu Beginn des Streams innerhalb dieses Zeitraums keine Sprache erkannt wird, schließt der Server den Stream.

speech_end_timeout

Duration

Dauer, nach der der Stream beendet wird, nachdem die Sprache beendet wurde. Wenn dies festgelegt ist und innerhalb dieses Zeitraums nach der Erkennung von Sprache keine Sprache erkannt wird, schließt der Server den Stream.

StreamingRecognitionResult

Ein Erkennungsergebnis für gestreamte Sprache, das einem Teil der Audiodaten entspricht, die aktuell verarbeitet werden.

Felder
alternatives[]

SpeechRecognitionAlternative

Kann eine oder mehrere Erkennungshypothesen enthalten. Die Alternativen sind nach Genauigkeit geordnet. Die beste (erste) Alternative ist dabei der Einstufung des Erkennungsmoduls zufolge die wahrscheinlichste.

is_final

bool

Bei false stellt StreamingRecognitionResult ein Zwischenergebnis dar, das sich ändern kann. Falls true, ist dies das letzte Mal, dass der Sprachdienst dieses spezifische StreamingRecognitionResult zurückgibt. Das Erkennungsmodul gibt keine weiteren Hypothesen für diesen Teil des Transkripts und die entsprechenden Audiodaten zurück.

stability

float

Eine Schätzung der Wahrscheinlichkeit dafür, dass die Vermutung im Hinblick auf dieses Zwischenergebnis vom Erkennungsmodul nicht geändert wird. Die Werte reichen von 0,0 (vollständig unzuverlässig) bis 1,0 (vollständig zuverlässig). Dieses Feld wird nur für Zwischenergebnisse (is_final=false) bereitgestellt. Der Standardwert 0,0 ist ein Sentinel-Wert, der angibt, dass stability nicht festgelegt wurde.

result_end_offset

Duration

Zeitverschiebung des Endes dieses Ergebnisses relativ zum Beginn des Audios.

channel_tag

int32

Bei Mehrkanalaudio ist dies die Kanalnummer, die dem erkannten Ergebnis für die Audiodaten aus diesem Kanal entspricht. Bei audio_channel_count = N können die Ausgabewerte zwischen 1 und N liegen.

language_code

string

Nur Ausgabe. Der Sprachcode BCP-47 der Sprache in diesem Ergebnis. Es wurde erkannt, dass dieser Sprachcode wahrscheinlich in der Audiodatei gesprochen wird.

StreamingRecognizeRequest

Anfragenachricht für die Methode StreamingRecognize. Es werden mehrere StreamingRecognizeRequest-Nachrichten in einem Aufruf gesendet.

Wenn die von recognizer referenzierte Recognizer eine vollständig angegebene Anfragekonfiguration enthält, darf der Stream nur Nachrichten mit nur audio enthalten.

Andernfalls muss die erste Nachricht eine recognizer- und eine streaming_config-Nachricht enthalten, die zusammen die Anfragekonfiguration vollständig angeben, und darf keine audio-Nachricht enthalten. In allen nachfolgenden Nachrichten darf nur audio festgelegt sein.

Felder
recognizer

string

Erforderlich. Der Name des Recognizer, der während der Erkennung verwendet werden soll. Das erwartete Format ist projects/{project}/locations/{location}/recognizers/{recognizer}. Das Segment {recognizer} kann auf _ gesetzt werden, um eine leere implizite Erkennung zu verwenden.

Union-Feld streaming_request.

Für streaming_request ist nur einer der folgenden Werte zulässig:

streaming_config

StreamingRecognitionConfig

StreamingRecognitionConfig, die bei diesem Erkennungsversuch verwendet werden soll. Falls angegeben, wird damit die im Recognizer gespeicherte Standard-RecognitionConfig überschrieben.

audio

bytes

Inline-Audiobytes, die erkannt werden sollen. Die maximale Größe für dieses Feld beträgt 15 KB pro Anfrage.

StreamingRecognizeResponse

StreamingRecognizeResponse ist die einzige Nachricht, die von StreamingRecognize an den Client zurückgegeben wird. Eine Reihe von null oder mehr StreamingRecognizeResponse-Nachrichten werden an den Client zurückgestreamt. Wenn kein Audio erkannt wird, werden keine Nachrichten an den Client zurückgestreamt.

Hier sind einige Beispiele für StreamingRecognizeResponse, die bei der Audioverarbeitung zurückgegeben werden können:

  1. results { alternatives { transcript: "seihen" } stability: 0.01 }

  2. results { alternatives { transcript: "seiner" } stability: 0.01 }

  3. results { alternatives { transcript: "sein" } stability: 0.9 } results { alternatives { transcript: " oder nicht sein" } stability: 0.01 }

  4. results { alternatives { transcript: "sein oder nicht sein" confidence: 0.92 } alternatives { transcript: "seihen oder nicht seihen" } is_final: true }

  5. results { alternatives { transcript: " dass ist" } stability: 0.01 }

  6. results { alternatives { transcript: " das ist" } stability: 0.9 } results { alternatives { transcript: " hier die Frage" } stability: 0.01 }

  7. results { alternatives { transcript: " das ist die Frage" confidence: 0.98 } alternatives { transcript: " das war die Frage" } is_final: true }

Hinweise:

  • Nur zwei der oben genannten Antworten (Nr. 4 und Nr. 7) enthalten endgültige Ergebnisse, die durch is_final: true gekennzeichnet sind. Werden diese Ergebnisse zusammengefügt, erhält man das vollständige Transkript: "sein oder nicht sein, das ist die Frage".

  • Die anderen enthalten Zwischenwerte results. #3 und #6 enthalten zwei vorläufige results: Der erste Abschnitt weist eine hohe Stabilität auf und ist weniger anfällig für Änderungen. Der zweite Teil hat eine geringe Stabilität und wird sich wahrscheinlich ändern. Ein UI-Designer kann sich dafür entscheiden, nur results mit hoher Stabilität anzuzeigen.

  • Die oben angegebenen spezifischen Werte für stability und confidence dienen nur zur Veranschaulichung. Die tatsächlichen Werte können davon abweichen.

  • In jeder Antwort wird nur eines der folgenden Felder festgelegt: error, speech_event_type oder eines oder mehrere (wiederholte) results.

Felder
results[]

StreamingRecognitionResult

Diese wiederholte Liste enthält null oder mehr Ergebnisse, die aufeinanderfolgenden Teilen der aktuell bearbeiteten Audiodaten entsprechen. Sie enthält null oder ein is_final=true-Ergebnis (den neu abgewickelten Teil), gefolgt von null oder mehr is_final=false-Ergebnissen (den Zwischenergebnissen).

speech_event_type

SpeechEventType

Gibt die Art des Sprachereignisses an.

speech_event_offset

Duration

Zeitverschiebung zwischen dem Beginn der Audio- und der Ereignisemission.

metadata

RecognitionResponseMetadata

Metadaten zur Erkennung.

SpeechEventType

Gibt die Art des Sprachereignisses an.

Enums
SPEECH_EVENT_TYPE_UNSPECIFIED Kein Sprachereignis angegeben.
END_OF_SINGLE_UTTERANCE Mit diesem Ereignis wird angezeigt, dass vom Server das Ende der sprachlichen Äußerung des Nutzers erkannt wurde und keine weiteren Sprachdaten erwartet werden. Daher werden keine weiteren Audiodaten vom Server verarbeitet und der bidirektionale gRPC-Stream wird geschlossen. Dieses Ereignis wird nur gesendet, wenn es aufgrund von Stille, die frühzeitig erkannt wurde, zu einem erzwungenen Abbruch kam. Diese Veranstaltung ist nur über die latest_short model verfügbar.
SPEECH_ACTIVITY_BEGIN Dieses Ereignis gibt an, dass der Server den Beginn der menschlichen Sprachaktivität im Stream erkannt hat. Dieses Ereignis kann mehrmals zurückgegeben werden, wenn die Sprache im Stream wiederholt beginnt und endet. Dieses Ereignis wird nur gesendet, wenn voice_activity_events auf „true“ gesetzt ist.
SPEECH_ACTIVITY_END Dieses Ereignis gibt an, dass der Server das Ende der menschlichen Sprachaktivität im Stream erkannt hat. Dieses Ereignis kann mehrmals zurückgegeben werden, wenn die Sprache im Stream wiederholt beginnt und endet. Dieses Ereignis wird nur gesendet, wenn voice_activity_events auf „true“ gesetzt ist.

TranscriptNormalization

Konfiguration der Transkriptionsnormalisierung. Mit der Transkriptnormalisierung können Sie automatisch bestimmte Teile des Transkripts durch von Ihnen ausgewählte Formulierungen ersetzen lassen. Bei StreamingRecognize gilt diese Normalisierung nur für stabile Teiltranskripte (Stabilität > 0, 8) und endgültige Transkripte.

Felder
entries[]

Entry

Eine Liste mit Ersatzeinträgen. Wir werden jeweils einen Eintrag ersetzen. Der zweite Eintrag in ["cat" => "dog", "mountain cat" => "mountain dog"] wird beispielsweise nie angewendet, da der erste Eintrag immer zuerst verarbeitet wird. Maximal 100 Einträge.

Eintrag

Eine einzelne Ersatzkonfiguration.

Felder
search

string

Was ersetzt werden soll. Darf maximal 100 Zeichen lang sein.

replace

string

Wodurch soll sie ersetzt werden? Darf maximal 100 Zeichen lang sein.

case_sensitive

bool

Gibt an, ob bei der Suche zwischen Groß- und Kleinschreibung unterschieden wird.

TranslationConfig

Übersetzungskonfiguration. Wird verwendet, um die angegebenen Audioinhalte in Text für die gewünschte Sprache zu übersetzen.

Felder
target_language

string

Erforderlich. Der Sprachcode, in den übersetzt werden soll.

UndeleteCustomClassRequest

Anfragenachricht für die Methode UndeleteCustomClass.

Felder
name

string

Erforderlich. Der Name der CustomClass, die wiederhergestellt werden soll. Format: projects/{project}/locations/{location}/customClasses/{custom_class}

validate_only

bool

Wenn festgelegt, wird die Anfrage validiert und eine Vorschau der nicht gelöschten CustomClass angezeigt, sie wird aber nicht tatsächlich wiederhergestellt.

etag

string

Diese Prüfsumme wird vom Server auf Grundlage des Werts anderer Felder berechnet. Kann bei Aktualisierungs-, Wiederherstellungs- und Löschanfragen gesendet werden, um sicherzustellen, dass der Client vor dem Fortfahren einen aktuellen Wert hat.

UndeletePhraseSetRequest

Anfragenachricht für die Methode UndeletePhraseSet.

Felder
name

string

Erforderlich. Der Name des PhraseSets, dessen Löschung rückgängig gemacht werden soll. Format: projects/{project}/locations/{location}/phraseSets/{phrase_set}

validate_only

bool

Wenn festgelegt, wird die Anfrage validiert und eine Vorschau des nicht gelöschten PhraseSet erstellt, es wird aber nicht tatsächlich wiederhergestellt.

etag

string

Diese Prüfsumme wird vom Server auf Grundlage des Werts anderer Felder berechnet. Kann bei Aktualisierungs-, Wiederherstellungs- und Löschanfragen gesendet werden, um sicherzustellen, dass der Client vor dem Fortfahren einen aktuellen Wert hat.

UndeleteRecognizerRequest

Anfragenachricht für die Methode UndeleteRecognizer.

Felder
name

string

Erforderlich. Der Name des Erkennungsmoduls, das wiederhergestellt werden soll. Format: projects/{project}/locations/{location}/recognizers/{recognizer}

validate_only

bool

Wenn festgelegt, wird die Anfrage validiert und eine Vorschau der nicht gelöschten Erkennung angezeigt, sie wird aber nicht tatsächlich wiederhergestellt.

etag

string

Diese Prüfsumme wird vom Server auf Grundlage des Werts anderer Felder berechnet. Kann bei Aktualisierungs-, Wiederherstellungs- und Löschanfragen gesendet werden, um sicherzustellen, dass der Client vor dem Fortfahren einen aktuellen Wert hat.

UpdateConfigRequest

Anfragenachricht für die Methode UpdateConfig.

Felder
config

Config

Erforderlich. Die zu aktualisierende Konfiguration.

Das Feld name der Konfiguration wird verwendet, um die zu aktualisierende Konfiguration zu identifizieren. Das erwartete Format ist projects/{project}/locations/{location}/config.

update_mask

FieldMask

Die Liste der zu aktualisierenden Felder.

UpdateCustomClassRequest

Anfragenachricht für die Methode UpdateCustomClass.

Felder
custom_class

CustomClass

Erforderlich. Die zu aktualisierende CustomClass.

Das Feld name von CustomClass wird verwendet, um die zu aktualisierende CustomClass zu identifizieren. Format: projects/{project}/locations/{location}/customClasses/{custom_class}.

update_mask

FieldMask

Die Liste der zu aktualisierenden Felder. Wenn leer, werden alle Felder für die Aktualisierung berücksichtigt.

validate_only

bool

Wenn festgelegt, wird die Anfrage validiert und eine Vorschau der aktualisierten CustomClass angezeigt, sie wird aber nicht tatsächlich aktualisiert.

UpdatePhraseSetRequest

Anfragenachricht für die Methode UpdatePhraseSet.

Felder
phrase_set

PhraseSet

Erforderlich. Das zu aktualisierende PhraseSet.

Das Feld name des PhraseSet wird verwendet, um das zu aktualisierende PhraseSet zu identifizieren. Format: projects/{project}/locations/{location}/phraseSets/{phrase_set}.

update_mask

FieldMask

Die Liste der zu aktualisierenden Felder. Wenn dieses Feld leer ist, werden alle Felder mit nicht standardmäßigen Werten für die Aktualisierung berücksichtigt. Verwenden Sie *, um die gesamte PhraseSet-Ressource zu aktualisieren.

validate_only

bool

Wenn festgelegt, wird die Anfrage validiert und eine Vorschau des aktualisierten PhraseSet angezeigt, es wird aber nicht tatsächlich aktualisiert.

UpdateRecognizerRequest

Anfragenachricht für die Methode UpdateRecognizer.

Felder
recognizer

Recognizer

Erforderlich. Der zu aktualisierende Recognizer.

Das Feld name des Recognizer wird verwendet, um den zu aktualisierenden Recognizer zu identifizieren. Format: projects/{project}/locations/{location}/recognizers/{recognizer}.

update_mask

FieldMask

Die Liste der zu aktualisierenden Felder. Wenn dieses Feld leer ist, werden alle Felder mit nicht standardmäßigen Werten für die Aktualisierung berücksichtigt. Verwenden Sie *, um die gesamte Recognizer-Ressource zu aktualisieren.

validate_only

bool

Wenn festgelegt, wird die Anfrage validiert und eine Vorschau des aktualisierten Recognizers angezeigt, er wird aber nicht tatsächlich aktualisiert.

VttOutputFileFormatConfig

Dieser Typ hat keine Felder.

Ausgabekonfigurationen für Untertiteldateien im WebVTT-Format.

WordInfo

Wortspezifische Informationen zu erkannten Wörtern

Felder
start_offset

Duration

Zeitverschiebung, bezogen auf den Beginn der Audiodaten und entsprechend dem Anfang des gesprochenen Worts. Dieses Feld wird nur bei enable_word_time_offsets und nur in der obersten Hypothese festgelegt.true Diese Funktion befindet sich in der Entwicklungsphase, sodass die Genauigkeit der Zeitverschiebung variieren kann.

end_offset

Duration

Zeitverschiebung, bezogen auf den Beginn der Audiodaten und entsprechend dem Ende des gesprochenen Worts. Dieses Feld wird nur bei enable_word_time_offsets und nur in der obersten Hypothese festgelegt.true Diese Funktion befindet sich in der Entwicklungsphase, sodass die Genauigkeit der Zeitverschiebung variieren kann.

word

string

Das Wort, auf das sich diese Informationen beziehen.

confidence

float

Eine Konfidenzschätzung zwischen 0,0 und 1,0. Je höher der Wert ist, desto höher ist die geschätzte Wahrscheinlichkeit, dass die Wörter korrekt erkannt wurden. Dieses Feld wird nur für die beste Alternative eines Nicht-Streaming-Ergebnisses oder eines Streaming-Ergebnisses festgelegt, bei dem is_final auf true gesetzt ist. Die Genauigkeit dieses Feldes kann nicht garantiert werden und Nutzer sollten sich nicht darauf verlassen, dass es immer zur Verfügung steht. Der Standardwert 0,0 ist ein Sentinel-Wert, der angibt, dass confidence nicht festgelegt wurde.

speaker_label

string

Jedem Sprecher im Audio wird ein eigenes Label zugewiesen. Dieses Feld gibt an, welcher dieser Sprecher jenes Wort gesprochen hat. speaker_label wird festgelegt, wenn SpeakerDiarizationConfig angegeben ist, und nur in der besten Alternative.