Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Viktigt!
Den här funktionen finns som allmänt tillgänglig förhandsversion.
AI Runtime integreras internt med MLflow för experimentspårning och innehåller ett inbyggt GPU-resursfönster för övervakning av användning, minne och temperatur. Använd MLflow för att logga mått och körningar, visa träningsutdata i notebook-filen och MLflow-användargränssnittet, spara modellkontrollpunkter i Unity Catalog-volymer och spåra GPU-hälsa medan koden körs.
MLflow-integrering
AI Runtime integreras internt med MLflow för experimentspårning, modellloggning och måttvisualisering.
Installationsrekommendationer:
Uppgradera MLflow till version 3.7 eller senare och följ arbetsflödesmönstren för djupinlärning.
Aktivera automatisk loggning för PyTorch Lightning:
import mlflow mlflow.pytorch.autolog()Anpassa MLflow-körningsnamnet genom att kapsla in din modellträningskod inom API-omfånget
mlflow.start_run(). Detta ger dig kontroll över körningsnamnet och gör att du kan starta om från en tidigare körning. Du kan anpassa körningsnamnet med hjälp av parameternrun_nameimlflow.start_run(run_name="your-custom-name")eller i bibliotek från tredje part som stöder MLflow (till exempel Hugging Face Transformers). Annars är standardkörningsnamnetjobTaskRun-xxxxx.from transformers import TrainingArguments args = TrainingArguments( report_to="mlflow", run_name="llama7b-sft-lr3e5", # <-- MLflow run name logging_steps=50, )När du använder det serverlösa GPU-API:et skapar varje anrop till
.distributed()automatiskt en MLflow-experimentkörning. Om den anropas inom en aktiv MLflow-körning skapas en kapslad underordnad körning under den aktiva överordnade körningen i stället.import mlflow with mlflow.start_run() as outer_run: ... run_train.distributed() # creates a nested child run under outer_runOm du vill anpassa experimentet som används av
.distributed()anroparmlflow.set_experiment()du innan du anropar.distributed()eller angerMLFLOW_EXPERIMENT_NAMEmiljövariabeln. Standardexperimentnamnet är/Users/{WORKSPACE_USER}/{notebook-name}. Använd alltid absoluta sökvägar.import mlflow mlflow.set_experiment("/Users/<username>/my-experiment") run_train.distributed()Alternatively:
import os os.environ["MLFLOW_EXPERIMENT_NAME"] = "/Users/<username>/my-experiment"Om du vill återuppta en tidigare MLflow-körning använder du
mlflow.start_run(run_id="<previous-run-id>").Om du vill återuppta en tidigare MLflow-körning med
.distributed(), anger duMLFLOW_RUN_IDinnan du anropar den:os.environ["MLFLOW_RUN_ID"] = "<previous-run-id>" run_train.distributed()Ange parametern
stepiMLFlowLoggertill rimliga batchnummer. MLflow har en gräns på 10 miljoner måttsteg, så att logga varje enskild batch på stora träningskörningar kan nå den här gränsen. Se Resursbegränsningar.
Visa loggar
- Notebook-utdata: Standardutdata och fel från träningskoden visas i notebook-cellens utdata.
- MLflow-loggar: Användargränssnittet för MLflow-experimentet visar träningsmått, parametrar och artefakter.
Kontrollpunkter för modell
För distribuerad träning, spara modell- och optimerartillstånd till Unity-katalogvolymer med hjälp av Torch Distributed Checkpoint (DCP) API:et med och serverless_gpu.data.UCVolumeWriterserverless_gpu.data.UCVolumeReader lagringsbackends. Spara asynkront så att träningen fortsätter medan checkpointen laddas upp, och checkpointen är tillräckligt ofta för att begränsa förlorat arbete efter ett avbrott. Eftersom en modellkontrollpunkt inte fångar datapipelinens position, kontrollera också din datapipeline så att en återupptagen körning fortsätter på rätt data.
För hela checkpointing-mönstret, se Förbättra träningsprestanda och motståndskraft på AI Runtime.
Övervaka GPU-resurser
Använd fönstret GPU-resurser för att övervaka GPU-hälsa och -användning medan koden körs på AI Runtime. Panelen stöder både arbetsbelastningar med en eller flera noder.
Om du vill öppna fönstret ansluter du anteckningsboken till AI Runtime och klickar sedan på GPU-resurser i fönstret till höger.
Fönstret visar följande mått för varje GPU:
- GPU-användningsprocent
- GPU-minnesanvändning
- Temperatur
Panelen hämtar mätvärden var tionde sekund och sparar upp till två timmars historik. Klicka på Uppdatera för att hämta de senaste värdena omedelbart. Efter 5 minuters inaktivitet pausar fönstret. öppna den igen för att återuppta övervakningen.
Samarbete mellan flera användare
- För att säkerställa att alla användare kan komma åt delad kod (till exempel hjälpmoduler eller YAML-miljöfiler) lagrar du dem i
/Workspace/Sharedstället för användarspecifika mappar som/Workspace/Users/<your_email>/. - För kod som är i aktiv utveckling använder du Git-mappar i användarspecifika mappar
/Workspace/Users/<your_email>/och push-överför till fjärranslutna Git-lagringsplatser. Detta gör att flera användare kan ha en användarspecifik klon och gren, samtidigt som de använder en fjärransluten Git-lagringsplats för versionskontroll. Se metodtips för att använda Git på Databricks. - Medarbetare kan dela och kommentera anteckningsböcker.