Runtime de IA

Importante

Esse recurso está em Visualização Pública.

O AI Runtime é uma oferta de computação no Databricks destinada a cargas de trabalho de aprendizado profundo e traz suporte de GPU para o Databricks Serverless. Você pode usar o AI Runtime para treinar e ajustar modelos personalizados usando suas estruturas favoritas e obter eficiência, desempenho e qualidade de última geração. Para obter uma visão geral de como a computação sem servidor se encaixa na arquitetura do Databricks, consulte a arquitetura do workspace sem servidor.

Características principais

  • Infraestrutura de GPU totalmente gerenciada: acesso flexível e sem servidor a GPUs e sem configuração de cluster, seleção de driver ou políticas de dimensionamento automático a serem gerenciadas.
  • Um runtime dedicado ao aprendizado profundo: escolha um ambiente Standard mínimo para obter flexibilidade máxima em relação a dependências ou um ambiente de IA completo pré-carregado com estruturas ML populares.
  • Integrados nativamente em notebooks, trabalhos, Catálogo do Unity e MLflow para desenvolvimento contínuo, acesso a dados e acompanhamento de experimentos.
  • Suporte à conformidade: dá suporte à maioria dos padrões de conformidade. Para obter os padrões e exceções com suporte, consulte o perfil de segurança de conformidade.
  • Acesso ao terminal web: Execute comandos shell, monitore o uso da GPU com nvidia-smi, e gerencie arquivos diretamente no computador quando conectado ao ambiente serverless de GPU versão 5 ou superior. Confira Executar comandos shell no terminal web do Azure Databricks.

Opções de hardware

Todos os aceleradores do AI Runtime provisionam um único nó. O número de GPUs nesse nó depende do tipo de acelerador:

Acelerador GPUs por nó Memória de GPU Mais adequado para Treinamento distribuído
1xA10 1 24 GB Tarefas de ML pequenas a médias e tarefas de aprendizado profundo, como o ajuste fino de modelos clássicos de ML ou de menores modelos de linguagem. Sem suporte (GPU única)
1xH100 1 80 GB Cargas de trabalho que precisam de mais memória de GPU do que a 1xA10 oferece, mas não exigem treinamento distribuído em várias GPUs, como o ajuste fino de modelos de linguagem de médio porte Sem suporte (GPU única)
8xH100 8 80 GB por GPU Cargas de trabalho de IA em larga escala, incluindo treinamento ou ajuste fino de modelos massivos ou execução de tarefas avançadas de aprendizado profundo Permitido usando o decorador @distributed com gpus=8

O Databricks recomenda o AI Runtime para qualquer caso de uso de treinamento de modelo personalizado que envolva aprendizado profundo, cargas de trabalho clássicas em larga escala ou GPUs.

Por exemplo:

  • Ajuste fino de LLM (LoRA, QLoRA, ajuste fino completo)
  • Pesquisa visual computacional (detecção de objetos, classificação de imagem)
  • Sistemas de recomendação baseados em aprendizado profundo
  • Aprendizado de reforço
  • Previsão de série temporal baseada em aprendizado profundo

Requisitos

  • Um workspace em uma das seguintes regiões com suporte Azure:
    • centralus
    • eastus
    • eastus2
    • northcentralus
    • westcentralus
    • westus
    • westus3

Limitações

  • O AI Runtime só dá suporte a aceleradores A10 e H100.
  • O AI Runtime não dá suporte ao perfil de segurança de conformidade para os padrões FedRAMP High ou DoD IL5. Todos os outros padrões de conformidade têm suporte.
  • Não há suporte para a adição de dependências usando o painel Ambientes para trabalhos agendados do AI Runtime. Em vez disso, instale dependências usando %pip install programaticamente em seu notebook.
  • Para trabalhos agendados no AI Runtime, não há suporte para o comportamento de recuperação automática para versões de pacote incompatíveis associadas ao seu notebook.
  • O tempo de execução máximo para uma carga de trabalho é de sete dias. Para trabalhos de treinamento de modelo que excedem esse limite, implemente a criação de pontos de verificação e reinicie o trabalho quando o tempo máximo de execução for atingido.
  • O AI Runtime fornece acesso sob demanda aos recursos de GPU. Embora isso leve a um acesso fácil e flexível a GPUs, pode haver períodos em que a capacidade está restrita ou indisponível em sua região.
  • O AI Runtime aproveita GPUs entre regiões em determinados casos durante momentos de alta demanda. Pode haver custos de saída associados a esse uso, e a conectividade de rede entre regiões pode ser limitada em determinados momentos.

Conectar-se ao AI Runtime

Você pode se conectar ao AI Runtime interativamente a partir de notebooks, um terminal IDE usando um túnel SSH, trabalhos agendados, a API de Trabalhos e Pacotes de Automação Declarativa. Para obter instruções passo a passo, consulte Conectar-se ao AI Runtime.

Configurar o ambiente

O AI Runtime oferece dois ambientes de Python gerenciados: um ambiente Standard mínimo e um ambiente de IA do Databricks completo pré-carregado com estruturas ML populares, como PyTorch e Transformers. Para obter detalhes sobre como escolher um ambiente, comportamento de cache, importação de módulos personalizados e limitações conhecidas, consulte Configurar seu ambiente.

Carregar dados no AI Runtime

Entender como o acesso a dados funciona no AI Runtime é essencial para uma experiência tranquila. Para obter detalhes, consulte Carregar dados no AI Runtime.

Treinamento distribuído

O AI Runtime oferece suporte ao treinamento distribuído em várias GPUs no único nó ao qual seu notebook está conectado. Usando o @distributed decorador da serverless_gpu API Python, você pode iniciar cargas de trabalho de várias GPUs com PyTorch DDP, FSDP ou DeepSpeed com configuração mínima. Para obter detalhes, consulte Treinamento distribuído em notebooks.

Ray no tempo de execução da IA

O AI Runtime suporta o Ray para cargas de trabalho distribuídas de GPU, incluindo Ray Core, Ray Data, Ray Train e Ray Tune. Você pode rodar trabalhos Ray de nó único e múltiplos em computação GPU serverless sem configuração de cluster. Para detalhes e exemplos, veja Ray sobre IA Runtime.

Acompanhamento e observabilidade de experimentos

Para a integração com o MLflow, visualização de logs e gerenciamento de checkpoints de modelo, consulte Acompanhamento de experimentos e observabilidade.

Código do Genie para aprendizado profundo

O Genie Code dá suporte a cargas de trabalho de aprendizado profundo no AI Runtime. Ele pode ajudar na geração de código de treinamento, na resolução de erros de instalação da biblioteca, na sugestão de otimizações e na depuração de problemas comuns. Consulte Usar o Genie Code para ciência de dados.

Guides

Para migrar de cargas de trabalho clássicas, notebooks de exemplo e solução de problemas, consulte guias de usuário para o AI Runtime.