View a markdown version of this page

Stellen Sie eine Verbindung zum primären Knoten für den Amazon EMR-Cluster her und führen Sie Abfragen aus - Amazon EMR

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Stellen Sie eine Verbindung zum primären Knoten für den Amazon EMR-Cluster her und führen Sie Abfragen aus

Stellen Sie Testdaten bereit und konfigurieren Sie Berechtigungen

Sie können Amazon EMR mit Trino testen, indem Sie den AWS Glue Data Catalog und den zugehörigen Hive-Metastore verwenden. Diese erforderlichen Schritte beschreiben, wie Sie Testdaten einrichten, falls Sie dies noch nicht getan haben:

  1. Erstellen Sie einen SSH-Schlüssel für die Kommunikationsverschlüsselung, falls Sie dies noch nicht getan haben.

  2. Sie können aus mehreren Dateisystemen wählen, um Daten und Protokolldateien zu speichern. Erstellen Sie zunächst einen Amazon S3-Bucket. Geben Sie dem Bucket einen eindeutigen Namen. Wenn Sie ihn erstellen, geben Sie den Verschlüsselungsschlüssel an, den Sie erstellt haben.

    Anmerkung

    Wählen Sie dieselbe Region aus, um sowohl Ihren Speicher-Bucket als auch den Amazon EMR-Cluster zu erstellen.

  3. Wählen Sie den Bucket aus, den Sie erstellt haben. Wählen Sie Ordner erstellen und geben Sie dem Ordner einen einprägsamen Namen. Wenn Sie den Ordner erstellen, wählen Sie eine Sicherheitskonfiguration. Sie können die Sicherheitseinstellungen für das übergeordnete Objekt auswählen oder die Sicherheitseinstellungen spezialisieren.

  4. Fügen Sie Testdaten zu Ihrem Ordner hinzu. Für die Zwecke dieses Tutorials eignet sich die Verwendung einer CSV-Datei mit kommagetrennten Datensätzen gut, um diesen Anwendungsfall abzuschließen.

  5. Nachdem Sie Daten zu einem Amazon S3-Bucket hinzugefügt haben, konfigurieren Sie eine Tabelle in AWS Glue, um eine Abstraktionsebene für die Abfrage der Daten bereitzustellen.

Stellen Sie Verbindungen her und führen Sie Abfragen aus

Im Folgenden wird beschrieben, wie Sie eine Verbindung zu einem Cluster herstellen und Abfragen auf einem Cluster ausführen, auf dem Trino ausgeführt wird. Bevor Sie dies tun, stellen Sie sicher, dass Sie den Hive-Metastore-Connector einrichten, der im vorherigen Verfahren beschrieben wurde, sodass die Metastore-Tabellen sichtbar sind.

  1. Wir empfehlen, EC2 Instance Connect zu verwenden, um eine Verbindung zu Ihrem Cluster herzustellen, da es eine sichere Verbindung bietet. Wählen Sie in der Cluster-Zusammenfassung mithilfe von SSH die Option Mit dem primären Knoten verbinden aus. Für die Verbindung muss die Sicherheitsgruppe über eine Regel für eingehenden Datenverkehr verfügen, die Verbindungen über Port 22 zu Clients im Subnetz zulässt. Sie müssen auch den Benutzer Hadoop verwenden, wenn Sie eine Verbindung herstellen.

  2. Starten Sie die Trino CLI, indem Sie sie ausführen. trino-cli Auf diese Weise können Sie Befehle ausführen und Daten mit Trino abfragen.

  3. Führen Sie show catalogs;. Vergewissern Sie sich, dass der Hive-Katalog aufgeführt ist. Dadurch wird eine Liste der verfügbaren Kataloge angezeigt, die Datenspeicher oder Systemeinstellungen enthalten.

  4. Um die verfügbaren Schemas anzuzeigen, führen Sie den Befehl aus. show schemas in hive; Von hier aus können Sie das Schema ausführen use schema-name; und den Namen Ihres Schemas angeben. Dann können Sie ausführenshow tables;, um Tabellen aufzulisten.

  5. Fragen Sie eine Tabelle abSELECT * FROM table-name, indem Sie einen Befehl wie ausführen und dabei den Namen einer Tabelle in Ihrem Schema verwenden. Wenn Sie die USE Anweisung bereits ausgeführt haben, um eine Verbindung zu einem bestimmten Schema herzustellen, müssen Sie keine zweiteilige Notation wie schema verwenden. table.