Назад
4 дня назад

Ingeniero ML / Data Scientist (NLP)

Формат работы
remote (Global)
Тип работы
fulltime
Грейд
senior
vacancy_detail.hirify_telegram_tooltipВакансия из Telegram канала -

Мэтч & Сопровод

Покажет вашу совместимость и напишет письмо

Описание вакансии

TL;DR
Ingeniero ML / Data Scientist (NLP): Construcción y evolución de un pipeline reproducible para transformar 1,8 millones de pares históricos en un dataset de entrenamiento y desarrollar un modelo NER en español, con an accent on weak supervision, fine-tuning de BERT y evaluación rigurosa. Focus on calibrar probabilidades, garantizar la reproducibilidad y preparar una inferencia eficiente en CPU para la adopción sostenida por el cliente.

FULL_TIME

Remote | Senior | Full time | Machine Learning & AI

27 applications

Replies between 13 and 29 days

Last checked today Lisit creamos, desarrollamos e implementamos servicios de software con foco constante en innovación y pasión por los desafíos. En este rol, trabajamos en la automatización y optimización de procesos mediante soluciones de NLP en español con impacto directo en la eficacia operativa de nuestros clientes. La misión del proyecto es construir y hacer evolucionar un pipeline reproducible a partir de

1,8 millones de pares históricos, transformándolo en un dataset de entrenamiento, entrenar y evaluar un modelo NER en español, calibrar el score de confianza y habilitar la transferencia del conocimiento y la solución al cliente para su adopción sostenida.

© Get on Board. All rights reserved.

  • Construir el dataset de entrenamiento sin etiquetado manual masivo (etiquetado programático / weak supervision).
  • Realizar tokenización y normalización de texto para NLP en español.
  • Entrenar y ajustar un modelo para NER en español (idealmente BERT en español, como BETO u otro BERT en español) con Transformers / Hugging Face.
  • Gestionar errores ortográficos y robustez del preprocesamiento.
  • Evaluar rigurosamente el desempeño con precision/recall/F1 usando conjuntos held-out y control de fuga de datos.
  • Calibrar probabilidades para que el umbral de confianza sea interpretable (score calibrado con métodos como Platt o isotónica).
  • Garantizar reproducibilidad: documentación del pipeline, trazabilidad de experimentos y empaquetado para que el cliente pueda replicarlo y operarlo.
  • Python sólido(pandas, scikit-learn) y experiencia real llevando un modelo a producción en- NLP en español.- Experiencia con tokenización,normalización de textoymanejo de errores ortográficos. - Experiencia con Transformers / Hugging Faceparafine-tuning de BERT(ideal BETO u otro BERT en español) orientado aNER. - Etiquetado programático / weak supervision: construir datasets de entrenamiento sin etiquetado manual masivo.- Evaluación rigurosa: precision/recall/F1, conjuntos held-out y- control de fuga de datos.
  • XGBoost y calibración de probabilidades(Platt / isotónica): el umbral de 0,82 debe significar probabilidad real.- Embeddings y búsqueda vectorial(pgvector, HNSW, sentence-transformers).- Fuzzy matching: distancias de edición, algoritmos fonéticos, pg_trgm.- MLflowpara gestión de experimentos y despliegue.- ONNX y cuantización INT8para inferencia eficiente en CPU (sin GPU).- libpostal.- Experiencia con direcciones postales, geocodificación o datos geográficos.

100% remoto

GETONBRD Job ID: 63251

Fully remote

Candidates can reside anywhere in the world.

Creamos, desarrollamos e implementamos servicios de software capaces de proporcionar herramientas de automatización y optimización requeridos manteniendo constante el foco de innovación y pasión por los desafíos. — Lisit's full profile

Будьте осторожны: если работодатель просит войти в их систему, используя iCloud/Google, прислать код/пароль, запустить код/ПО, не делайте этого - это мошенники. Обязательно жмите "Пожаловаться" или пишите в поддержку. Подробнее в гайде →

Текст вакансии взят без изменений

Источник -