ML Platform

Создаём единую ML-инфраструктуру полного цикла для команд Яндекса: от подготовки данных и экспериментов до обучения моделей на кластерах с тысячами GPU, инференса и запуска в прод. Сокращаем путь от идеи до продукта.

 
>1000

пользователей — ML-разработчиков

 
петабайты

метрик обучения

 
десятки тысяч

GPU

 
>100 тыс.

запусков обучений в день

Эффективные решения

Dev Cluster

Managed GPU Cluster предоставляет контейнеры для локальной разработки на CPU и GPU, автоматически распределяет ресурсы и обрабатывает сбои инфраструктуры.

  • Бесшовное переключение между конфигурациями с GPU и без него.
  • Обмен разными типами GPU между командами.
  • Интеграция с YTsaurus для обучения на больших объёмах данных.
  • Оптимизация распределения ресурсов.
  • Преднастроенная среда для ML-инженеров.

Experiment Manager

Система сбора, анализа и сравнения метрик обучения ML-моделей.

  • Одновременный сбор метрик с тысяч обучений.
  • Конфигурируемые дашборды с виджетами для изображений, видео и аудио.
  • Сравнение больших таблиц с данными.
  • Проведение экспериментов и анализ результатов.
  • Подбор гиперпараметров.

YTsaurus

Платформа распределённого хранения и обработки больших данных с открытым исходным кодом.

  • Гибкое распределение ресурсов GPU между командами.
  • Поддержка всех этапов ML-пайплайна: подготовки данных, обучения моделей, валидации и инференса.
  • Обучение больших моделей.
  • Потоковая обработка и быстрый цикл обновлений.

Artefact Registry + Inference

Система хранения, версионирования артефактов и управления их жизненным циклом.

  • Оптимизированное хранение файлов.
  • Механизмы публикации артефактов.
  • Передача моделей в инференс.
  • Зеркалирование открытых репозиториев моделей.

Вклад в опенсорс

YTsaurus

Платформа хранения и обработки данных.

VERL

Фреймворк для Reinforcement Learning.

Собственные разработки

Стек и технологии

Python

Идеальный выбор для быстрой разработки, анализа данных и автоматизации задач, когда важны простота кода и богатая экосистема библиотек.

Go

Обеспечивает читаемость, быстроту написания кода, лёгкость в распараллеливании и приемлемую производительность.

YTsaurus

Система распределённого хранения и обработки больших данных.

Porto

Внутренний аналог Docker.

gRPC

Основной способ построения API: быстро, производительно и без поломок обратной совместимости.

PostgreSQL, ClickHouse, Redis

Современные производительные базы данных.

Статьи и выступления команды

Как попасть
в направление

Ждём в команду опытных разработчиков и технических менеджеров, чтобы вместе проектировать и развивать инструменты полного цикла ML-разработки, которые помогают многим командам Яндекса, в том числе Алисе, Автономному транспорту и другим, выпускать передовые модели.

Если вы хотите расти и развиваться, участвовать в разработке технологий мирового уровня для ML, присоединяйтесь!