Expertises
PythonMachine LearningKubernetesLLMOps
il y a 8 heures
Candidature rapide
Partagez cette opportunité
Partagez cette opportunité à quelqu’un de votre réseau :
✓ Offrez-lui un boost de visibilité auprès du client.
✓ Aidez vos contacts à trouver leur prochain job.
Information importante
Type de contrat:
Freelance / Contrat
Taux journalier :
TJM 675 EUR/jour
Cette offre est à 0% de commission 🎉Mode de travail :
Hybride
Publié le :
8 octobre 2026
Le besoin
CONTEXTE
Mission au sein d'un grand compte du Transport ferroviaire, sur la construction et l'exploitation d'un socle agentique IA. Le périmètre couvre le serving de modèles de langage (LLM), la mise en place des infrastructures d'inférence GPU sous Kubernetes, et l'outillage MLOps/LLMOps associé (observabilité, versioning, alerting). La mission s'inscrit dans un contexte hybride, basé à Saint-Denis (Île-de-France), pour une durée initiale d'un an ferme.
MISSIONS PRINCIPALES
- Concevoir et opérer l'infrastructure de serving de modèles LLM (APIs d'inférence, gestion des endpoints)
- Déployer et administrer les workloads GPU sous Kubernetes pour l'inférence à grande échelle
- Mettre en place et maintenir les pipelines MLOps/LLMOps (versioning de modèles, registre, promotion)
- Implémenter les dispositifs d'observabilité : dashboards, alerting et monitoring des modèles en production
- Développer et maintenir les composants Python du socle agentique (scripts, orchestration, intégrations API)
- Assurer la fiabilité et la performance des APIs d'inférence exposées aux équipes consommatrices
- Contribuer à la définition des standards et bonnes pratiques LLMOps au sein de l'équipe
- Participer aux revues techniques et à la documentation du socle agentique
COMPETENCES REQUISES
- Python (développement des composants du socle agentique et scripts MLOps)
- Kubernetes (déploiement et orchestration des workloads GPU d'inférence)
- GPU (infrastructure d'inférence) (gestion des ressources GPU pour le serving de modèles LLM)
- MLOps (pipelines de gestion du cycle de vie des modèles)
- LLMOps (opérationnalisation spécifique des modèles de langage)
- APIs d'inférence (exposition et gestion des endpoints de serving)
- Observabilité (monitoring des modèles et de l'infrastructure en production)
- Versioning de modèles (gestion des versions et registre de modèles)
- Dashboards / Alerting (mise en place des tableaux de bord et alertes de supervision)
COMPETENCES SOUHAITEES
- vLLM / TGI (Text Generation Inference) (frameworks de serving LLM haute performance)
- Helm / Kustomize (gestion des déploiements Kubernetes)
- Prometheus / Grafana (stack d'observabilité et dashboarding)
- MLflow / Weights & Biases (registre et tracking d'expériences de modèles)
- Docker (conteneurisation des composants d'inférence)
- Amazon Web Services ou Google Cloud Platform (infrastructure cloud sous-jacente)
- LangChain / LlamaIndex (frameworks d'orchestration agentique)
PROFIL RECHERCHE
Expert LLMOps / Model Serving Engineer justifiant d'au minimum 7 ans d'expérience globale en ingénierie, dont une expertise avérée et récente sur l'opérationnalisation de modèles de langage (LLMOps), le serving GPU sous Kubernetes et la mise en place de dispositifs d'observabilité en production. Une expérience sur des socles agentiques ou des projets IA à grande échelle est fortement appréciée. Autonomie, rigueur technique et capacité à structurer des pratiques d'ingénierie dans un environnement complexe sont indispensables ; une bonne communication avec les équipes data et produit est attendue.
Profil recherché
Expert LLMOps / Model Serving Engineer justifiant d'au minimum 13 ans d'expérience globale en ingénierie, dont une expertise avérée et récente sur l'opérationnalisation de modèles de langage (LLMOps), le serving GPU sous Kubernetes et la mise en place de dispositifs d'observabilité en production. Une expérience sur des socles agentiques ou des projets IA à grande échelle est fortement appréciée. Autonomie, rigueur technique et capacité à structurer des pratiques d'ingénierie dans un environnement complexe sont indispensables ; une bonne communication avec les équipes data et produit est attendue.
D'autres offres idéales pour vous !
Ces entreprises cherchent également d'excellents profils
E
EAYS Consulting
Tech Lead Full Stack Data/IA – – Saint-Denis
TJM 575 EUR/jour
Freelance
Hybride
Expertises
DockerReactAngularDjangoPythonJavaSpring BootDatabricksJenkinsAWSKubernetesFastAPIApache SparkAzureSpring WebFluxApache NiFiGitLab CI/CD
il y a 3 jours
Candidature rapide
E
EAYS Consulting
Data Engineer – Socle agentique IA / – Saint-Denis
TJM 673 EUR/jour
Freelance
Hybride
Expertises
PythonKubernetesRAGData Pipelines
il y a 3 jours
Candidature rapide
U
Unitech Solutions
Consultant LLMOps / Model Serving
~600
Freelance
Paris, France
Hybride
Expertises
PythonKubernetesLLMOpsModel ServingInference APIsGPU optimization
il y a 1 jour
Candidature rapide