Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Stellen Sie eine Verbindung zum primären Knoten für den Amazon EMR-Cluster her und führen Sie Abfragen aus
Stellen Sie Testdaten bereit und konfigurieren Sie Berechtigungen
Sie können Amazon EMR mit Trino testen, indem Sie den AWS Glue Data Catalog und den zugehörigen Hive-Metastore verwenden. Diese erforderlichen Schritte beschreiben, wie Sie Testdaten einrichten, falls Sie dies noch nicht getan haben:
Erstellen Sie einen SSH-Schlüssel für die Kommunikationsverschlüsselung, falls Sie dies noch nicht getan haben.
Sie können aus mehreren Dateisystemen wählen, um Daten und Protokolldateien zu speichern. Erstellen Sie zunächst einen Amazon S3-Bucket. Geben Sie dem Bucket einen eindeutigen Namen. Wenn Sie ihn erstellen, geben Sie den Verschlüsselungsschlüssel an, den Sie erstellt haben.
Anmerkung
Wählen Sie dieselbe Region aus, um sowohl Ihren Speicher-Bucket als auch den Amazon EMR-Cluster zu erstellen.
Wählen Sie den Bucket aus, den Sie erstellt haben. Wählen Sie Ordner erstellen und geben Sie dem Ordner einen einprägsamen Namen. Wenn Sie den Ordner erstellen, wählen Sie eine Sicherheitskonfiguration. Sie können die Sicherheitseinstellungen für das übergeordnete Objekt auswählen oder die Sicherheitseinstellungen spezialisieren.
Fügen Sie Testdaten zu Ihrem Ordner hinzu. Für die Zwecke dieses Tutorials eignet sich die Verwendung einer CSV-Datei mit kommagetrennten Datensätzen gut, um diesen Anwendungsfall abzuschließen.
Nachdem Sie Daten zu einem Amazon S3-Bucket hinzugefügt haben, konfigurieren Sie eine Tabelle in AWS Glue, um eine Abstraktionsebene für die Abfrage der Daten bereitzustellen.
Stellen Sie Verbindungen her und führen Sie Abfragen aus
Im Folgenden wird beschrieben, wie Sie eine Verbindung zu einem Cluster herstellen und Abfragen auf einem Cluster ausführen, auf dem Trino ausgeführt wird. Bevor Sie dies tun, stellen Sie sicher, dass Sie den Hive-Metastore-Connector einrichten, der im vorherigen Verfahren beschrieben wurde, sodass die Metastore-Tabellen sichtbar sind.
Wir empfehlen, EC2 Instance Connect zu verwenden, um eine Verbindung zu Ihrem Cluster herzustellen, da es eine sichere Verbindung bietet. Wählen Sie in der Cluster-Zusammenfassung mithilfe von SSH die Option Mit dem primären Knoten verbinden aus. Für die Verbindung muss die Sicherheitsgruppe über eine Regel für eingehenden Datenverkehr verfügen, die Verbindungen über Port 22 zu Clients im Subnetz zulässt. Sie müssen auch den Benutzer Hadoop verwenden, wenn Sie eine Verbindung herstellen.
Starten Sie die Trino CLI, indem Sie sie ausführen.
trino-cliAuf diese Weise können Sie Befehle ausführen und Daten mit Trino abfragen.Führen Sie
show catalogs;. Vergewissern Sie sich, dass der Hive-Katalog aufgeführt ist. Dadurch wird eine Liste der verfügbaren Kataloge angezeigt, die Datenspeicher oder Systemeinstellungen enthalten.Um die verfügbaren Schemas anzuzeigen, führen Sie den Befehl aus.
show schemas in hive;Von hier aus können Sie das Schema ausführenuseund den Namen Ihres Schemas angeben. Dann können Sie ausführenschema-name;show tables;, um Tabellen aufzulisten.Fragen Sie eine Tabelle ab
SELECT * FROM, indem Sie einen Befehl wie ausführen und dabei den Namen einer Tabelle in Ihrem Schema verwenden. Wenn Sie dietable-nameUSEAnweisung bereits ausgeführt haben, um eine Verbindung zu einem bestimmten Schema herzustellen, müssen Sie keine zweiteilige Notation wieschemaverwenden.table.