Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Dieses Tutorial führt Sie durch die Einrichtung der Databricks-IDE-Erweiterung und führt Sie dann Python auf einem Azure Databricks-Cluster und als Azure Databricks-Job in Ihrem entfernten Arbeitsbereich aus. Siehe die IDE-Erweiterung Databricks.
Anforderungen
Für dieses Tutorial ist Folgendes erforderlich:
- Sie haben die IDE-Erweiterung Databricks installiert. Siehe Install the Databricks IDE-Erweiterung.
- Sie verfügen über einen Remote-Azure Databricks-Cluster zur Nutzung. Notieren Sie sich den Namen des Clusters. Klicken Sie zum Anzeigen der verfügbaren Cluster in der Azure Databricks Arbeitsbereich-Randleiste auf Compute. Siehe Compute.
Schritt 1: Erstellen eines neuen Databricks-Projekts
In diesem Schritt erstellen Sie ein neues Databricks-Projekt und konfigurieren die Verbindung mit Ihrem Remote-Azure Databricks Arbeitsbereich.
- Starten Sie Visual Studio Code, klicken Sie dann auf File > Open Folder und öffnen Sie einen leeren Ordner auf Ihrem lokalen Entwicklungscomputer.
- Klicken Sie in der Randleiste auf das Databricks-Logosymbol. Dadurch wird die Databricks-Erweiterung geöffnet.
- Klicken Sie in der Ansicht Konfiguration auf Konfiguration erstellen.
- Die Befehlspalette zum Konfigurieren des Databricks-Arbeitsbereichs wird geöffnet. Geben Sie für Databricks-Host Ihre arbeitsbereichsspezifische URL ein oder wählen Sie sie aus, z. B.
https://adb-1234567890123456.7.azuredatabricks.net. - Wählen Sie ein Authentifizierungsprofil für das Projekt aus. Siehe Einrichten der Autorisierung für die Databricks IDE-Erweiterung.
Schritt 2: Hinzufügen von Clusterinformationen zur Databricks-Erweiterung und Starten des Clusters
Klicken Sie bei bereits geöffneter Ansicht Konfiguration auf Cluster auswählen oder auf das Zahnradsymbol (Cluster konfigurieren).
Wählen Sie in der Befehlspalette den Namen des zuvor erstellten Clusters aus.
Klicken Sie auf das Wiedergabesymbol (Cluster starten), wenn es noch nicht gestartet ist.
Schritt 3: Erstellen und Ausführen von Python Code
Erstellen Sie eine lokale Python Codedatei: Klicken Sie auf der Randleiste auf das Ordnersymbol (Explorer).
Klicken Sie im Hauptmenü auf Datei > Neue Datei und wählen Sie eine Python Datei aus. Benennen Sie die Datei demo.py , und speichern Sie sie im Stammverzeichnis des Projekts.
Fügen Sie der Datei den folgenden Code hinzu, und speichern Sie sie. Dieser Code erstellt und zeigt den Inhalt eines einfachen PySpark-DataFrames an:
from pyspark.sql import SparkSession from pyspark.sql.types import * spark = SparkSession.builder.getOrCreate() schema = StructType([ StructField('CustomerID', IntegerType(), False), StructField('FirstName', StringType(), False), StructField('LastName', StringType(), False) ]) data = [ [ 1000, 'Mathijs', 'Oosterhout-Rijntjes' ], [ 1001, 'Joost', 'van Brunswijk' ], [ 1002, 'Stan', 'Bokenkamp' ] ] customers = spark.createDataFrame(data, schema) customers.show()# +----------+---------+-------------------+ # |CustomerID|FirstName| LastName| # +----------+---------+-------------------+ # | 1000| Mathijs|Oosterhout-Rijntjes| # | 1001| Joost| van Brunswijk| # | 1002| Stan| Bokenkamp| # +----------+---------+-------------------+Klicken Sie auf das Symbol In Databricks ausführen neben der Liste der Editor-Registerkarten und dann auf Datei hochladen und ausführen. Die Ausgabe wird in der Ansicht Debugging-Konsole angezeigt.
Alternativ dazu können Sie in der Ansicht Explorer mit der rechten Maustaste auf die Datei
demo.pyund dann auf In Databricks ausführen>Datei hochladen und ausführen klicken.
Schritt 4: Ausführen des Codes als Auftrag
Klicken Sie zum Ausführen von demo.py als Auftrag neben der Liste der Editorregisterkarten auf das Symbol In Databricks ausführen und dann auf Datei als Workflow ausführen. Die Ausgabe wird auf einer separaten Editor-Tab neben dem demo.py Dateieditor angezeigt.
Alternativ dazu können Sie mit der rechten Maustaste auf die Datei im demo.py-Bereich klicken und dann Auf Databricks ausführen> auswählen.
Nächste Schritte
Nachdem Sie nun erfolgreich die IDE-Erweiterung Databricks genutzt haben, um eine lokale Python-Datei hochzuladen und aus der Ferne auszuführen, können Sie außerdem:
- Erkunden Sie deklarative Automatisierungspakete, Ressourcen und Variablen mithilfe der Erweiterungs-UI. Siehe Bundle- und Explorer-Funktionen.
- Ausführen oder Debuggen von Python Code mit Databricks Connect. Siehe Debug-Code mit Databricks Connect für die Databricks IDE-Erweiterung.
- Führen Sie eine Datei oder ein Notizbuch als Azure Databricks Auftrag aus. Siehe Run a file on a cluster or a file or notebook as a job in Azure Databricks mit der Databricks IDE-Erweiterung.
- Test mit
pytestausführen. Siehe Run Python tests mit der Databricks IDE-Erweiterung.