Daten aus MongoDB-Datenbanken streamen

Datastream unterstützt die Replikation von Änderungsereignissen aus einer MongoDB-Quelle. MongoDB ist eine Open-Source-NoSQL-Datenbank, die JSON-ähnliche Dokumente verwendet. Ein Dokument kann andere eingebettete Dokumente enthalten. Die Dokumente werden in Sammlungen zusammengefasst und in einer MongoDB-Datenbank werden eine oder mehrere Sammlungen von Dokumenten gespeichert.

Anstatt Daten in Tabellen mit Zeilen und Spalten wie in relationalen SQL-Datenbanken zu speichern, ist jeder Datensatz in einer MongoDB-Datenbank ein Dokument, das in binärem JSON (BSON) beschrieben wird, einer binären Darstellung von Daten. Anwendungen können diese Daten dann im JSON-Format abrufen.

Diese Seite enthält Informationen zu folgenden Themen:

  • Die wichtigsten Begriffe, die Sie bei der Replikation aus einer MongoDB-Datenbank kennen müssen
  • Der Umgang von Datastream mit Daten, die aus einer MongoDB-Quelldatenbank abgerufen werden
  • Die Versionen und Editionen von MongoDB, die von Datastream unterstützt werden
  • Bekannte Einschränkungen bei Verwendung von MongoDB als Quelle

Wichtige Begriffe

Die folgenden Begriffe sollten Sie kennen, wenn Sie mit MongoDB-Quellen arbeiten:

  • SRV-Verbindung: Ein Verbindungsstring mit einem Hostnamen, der einem DNS-Dienstdatensatz (Domain Name Service) entspricht. Der String hat das folgende Format:

    mongodb+srv://[username:password@]host[/[defaultauthdb][?options]]

    Weitere Informationen finden Sie in der MongoDB-Dokumentation.

  • Standardverbindungsstring: Das Standardformat des MongoDB Verbindungs-URI, das verwendet wird, um eine Verbindung zu einer selbst gehosteten eigenständigen MongoDB-Bereitstellung, einem Replikatset oder einem fragmentierten Cluster herzustellen. Der String hat das folgende Format:

    mongodb://[username:password@]host1[:port1][,...hostN[:portN]][/[defaultauthdb][?options]]

    Weitere Informationen finden Sie in der MongoDB-Dokumentation.

  • Replikatset: Ein Cluster von MongoDB-Servern, der Replikation und automatisches Failover implementiert. Replikatsets bieten Redundanz und Hochverfügbarkeit und sind die Grundlage für alle Produktionsbereitstellungen.

  • Fragmentierter Cluster: Ein fragmentierter MongoDB-Cluster besteht aus Shards, Mongos und Konfigurationsservern. MongoDB fragmentiert Daten auf Sammlungsebene und verteilt die Sammlungsdaten auf die Shards im Cluster.

  • Mongos: Die Schnittstelle zwischen den Clientanwendungen und dem fragmentierten Cluster. mongos fungieren als Abfragerouter und schreiben Vorgänge in Shards.

  • Sammlung: MongoDB organisiert Daten in einer hierarchischen Struktur. Eine MongoDB-Bereitstellung enthält eine oder mehrere Datenbanken und jede Datenbank enthält eine oder mehrere Sammlungen. In jeder Sammlung speichert MongoDB Daten als Dokumente, die Feld- und Wertepaare enthalten. Sammlungen entsprechen Tabellen in relationalen Datenbanken.

Verhalten

Die MongoDB-Quelldatenbank verwendet Änderungsstreams, um Änderungen in das Ziel zu replizieren. Mit Änderungsstreams können Sie in Echtzeit auf Daten zugreifen. Sie werden für Replikatsets und fragmentierte Cluster unterstützt.

  • Wenn konfiguriert, werden alle Verlaufsdaten für eingeschlossene Objekte repliziert.
  • Alle Änderungen wie Einfügungen, Aktualisierungen und Löschungen aus den angegebenen Objekten werden repliziert.

Versionen

Datastream unterstützt MongoDB-Versionen nach 5.0.

Bekannte Einschränkungen

Bekannte Einschränkungen bei Verwendung von MongoDB als Quelle:

  • Wenn Sie die Datastream API verwenden, können Sie nur angeben, welche Felder Sie in Ihrem Stream ausschließen möchten. Das Angeben einer Liste der einzuschließenden Felder wird nicht unterstützt.
  • Datastream unterstützt Azure Cosmos DB auf Basis von Request Units (RU) nicht.
  • Datastream unterstützt Amazon DocumentDB Elastic Clusters nicht.

Nächste Schritte