Назад
обновлено 3 дня назад

Pretrain Data LLM Researcher (GigaChat)

400 000 - 1 000 000
Тип работы
fulltime
Грейд
middle/senior
Страна
Russia/Belarus
RUВакансия из Hirify RU, списка российских tech-компаний

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

Текст:
/
TL;DR
Pretrain Data LLM Researcher (GigaChat): Исследование и оптимизация претрейн-данных для фронтирной LLM с акцентом на ablation-эксперименты, масштабирование корпуса до триллионов токенов и измерение влияния данных на качество модели. Focus on проектирование контролируемых экспериментов, синтетические данные для рассуждений и кода, дедупликацию, фильтрацию и замыкание цикла «данные → обучение → оценка».

Зарплата: от 400 000 ₽ в месяц до вычета налогов

Компания

ML-команда развивает GigaChat — собственную фронтирную языковую модель, обучаемую с нуля и ориентированную на открытый доступ и мировой уровень качества.

Что делать

  • Вести программу экспериментов с претрейн-данными: формулировать гипотезы, проектировать эксперименты, запускать обучающие прогоны и анализировать результаты.
  • Оптимизировать состав и порядок использования данных при фиксированном вычислительном бюджете, применяя идеи scaling laws.
  • Разрабатывать измеримые сигналы качества данных, включая классификаторы для документов с рассуждениями, кодом и знаниями.
  • Курировать корпуса масштаба триллионов токенов, выполнять точную и fuzzy-дедупликацию, фильтрацию, очистку от утечек бенчмарков и преобразование HTML.
  • Собирать данные для agentic-pretrain: траектории использования инструментов, многошаговые рассуждения и взаимодействие со средой.
  • Создавать синтетические данные для развития длинного контекста, рассуждений и навыков программирования, связывая подготовку данных, обучение и оценку.

Требования

  • Сильная экспериментальная практика в ML и умение самостоятельно вести исследовательское направление от вопроса до измеримого результата.
  • Знание основ машинного обучения и статистики, культура контролируемого эксперимента: гипотеза, дизайн, измерение и вывод.
  • Уверенный Python и опыт обучения моделей на PyTorch или аналогичных фреймворках.
  • Теоретическое понимание цикла обучения LLM, включая токенизацию, scaling laws и влияние состава данных на качество.
  • Знакомство с распределённой обработкой данных и инструментами Spark, Dask, Airflow или Kubernetes.
  • Представление об открытых data-проектах FineWeb, OLMo и Dolma.

Хорошо, если есть

  • Опыт работы с LLM не обязателен; релевантным считается сильный исследовательский опыт в компьютерном зрении, рекомендательных системах, классическом ML или науке.

Культура и преимущества

  • Вычислительные ресурсы и один из крупнейших GPU-кластеров в стране для регулярных ablation-экспериментов.
  • Работа над претрейном собственной модели размером 400–700B параметров с планами масштабирования до 1.5–2T.
  • Минимум бюрократии, высокая самостоятельность и оценка по измеримому приросту модели на бенчмарках.
  • Развитая инфраструктура: S3, YTsaurus, Airflow, DataLens, GitLab CI и wandb.
  • Открытая публикация моделей и возможность влиять на результат, который будет виден ML-сообществу.

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →