Trouver une offreRecruteurs

LLMOps / Model Serving – Socle agentique – – Saint-Denis

Opportunité exclusive

Hybride

LLMOps / Model Serving – Socle agentique – – Saint-Denis

EAYS Consulting

LLMOps / Model Serving – Socle agentique – – Saint-Denis

Expertises

PythonMachine LearningKubernetesLLMOps

il y a 8 heures

Candidature rapide

Partagez cette opportunité

Partagez cette opportunité à quelqu’un de votre réseau :
✓ Offrez-lui un boost de visibilité auprès du client.
✓ Aidez vos contacts à trouver leur prochain job.

Information importante


Type de contrat:

Freelance / Contrat

Taux journalier :

TJM 675 EUR/jour

Cette offre est à 0% de commission 🎉

Mode de travail :

Hybride

Publié le :

8 octobre 2026

Le besoin


CONTEXTE Mission au sein d'un grand compte du Transport ferroviaire, sur la construction et l'exploitation d'un socle agentique IA. Le périmètre couvre le serving de modèles de langage (LLM), la mise en place des infrastructures d'inférence GPU sous Kubernetes, et l'outillage MLOps/LLMOps associé (observabilité, versioning, alerting). La mission s'inscrit dans un contexte hybride, basé à Saint-Denis (Île-de-France), pour une durée initiale d'un an ferme. MISSIONS PRINCIPALES - Concevoir et opérer l'infrastructure de serving de modèles LLM (APIs d'inférence, gestion des endpoints) - Déployer et administrer les workloads GPU sous Kubernetes pour l'inférence à grande échelle - Mettre en place et maintenir les pipelines MLOps/LLMOps (versioning de modèles, registre, promotion) - Implémenter les dispositifs d'observabilité : dashboards, alerting et monitoring des modèles en production - Développer et maintenir les composants Python du socle agentique (scripts, orchestration, intégrations API) - Assurer la fiabilité et la performance des APIs d'inférence exposées aux équipes consommatrices - Contribuer à la définition des standards et bonnes pratiques LLMOps au sein de l'équipe - Participer aux revues techniques et à la documentation du socle agentique COMPETENCES REQUISES - Python (développement des composants du socle agentique et scripts MLOps) - Kubernetes (déploiement et orchestration des workloads GPU d'inférence) - GPU (infrastructure d'inférence) (gestion des ressources GPU pour le serving de modèles LLM) - MLOps (pipelines de gestion du cycle de vie des modèles) - LLMOps (opérationnalisation spécifique des modèles de langage) - APIs d'inférence (exposition et gestion des endpoints de serving) - Observabilité (monitoring des modèles et de l'infrastructure en production) - Versioning de modèles (gestion des versions et registre de modèles) - Dashboards / Alerting (mise en place des tableaux de bord et alertes de supervision) COMPETENCES SOUHAITEES - vLLM / TGI (Text Generation Inference) (frameworks de serving LLM haute performance) - Helm / Kustomize (gestion des déploiements Kubernetes) - Prometheus / Grafana (stack d'observabilité et dashboarding) - MLflow / Weights & Biases (registre et tracking d'expériences de modèles) - Docker (conteneurisation des composants d'inférence) - Amazon Web Services ou Google Cloud Platform (infrastructure cloud sous-jacente) - LangChain / LlamaIndex (frameworks d'orchestration agentique) PROFIL RECHERCHE Expert LLMOps / Model Serving Engineer justifiant d'au minimum 7 ans d'expérience globale en ingénierie, dont une expertise avérée et récente sur l'opérationnalisation de modèles de langage (LLMOps), le serving GPU sous Kubernetes et la mise en place de dispositifs d'observabilité en production. Une expérience sur des socles agentiques ou des projets IA à grande échelle est fortement appréciée. Autonomie, rigueur technique et capacité à structurer des pratiques d'ingénierie dans un environnement complexe sont indispensables ; une bonne communication avec les équipes data et produit est attendue.

Profil recherché


Expert LLMOps / Model Serving Engineer justifiant d'au minimum 13 ans d'expérience globale en ingénierie, dont une expertise avérée et récente sur l'opérationnalisation de modèles de langage (LLMOps), le serving GPU sous Kubernetes et la mise en place de dispositifs d'observabilité en production. Une expérience sur des socles agentiques ou des projets IA à grande échelle est fortement appréciée. Autonomie, rigueur technique et capacité à structurer des pratiques d'ingénierie dans un environnement complexe sont indispensables ; une bonne communication avec les équipes data et produit est attendue.

D'autres offres idéales pour vous !

Ces entreprises cherchent également d'excellents profils

EAYS Consulting

Tech Lead Full Stack Data/IA – – Saint-Denis

TJM 575 EUR/jour

Freelance

Hybride

Expertises

DockerReactAngularDjangoPythonJavaSpring BootDatabricksJenkinsAWSKubernetesFastAPIApache SparkAzureSpring WebFluxApache NiFiGitLab CI/CD

il y a 3 jours

Candidature rapide

EAYS Consulting

Data Engineer – Socle agentique IA / – Saint-Denis

TJM 673 EUR/jour

Freelance

Hybride

Expertises

PythonKubernetesRAGData Pipelines

il y a 3 jours

Candidature rapide

Unitech Solutions

Consultant LLMOps / Model Serving

~600

Freelance

Paris, France

Hybride

Expertises

PythonKubernetesLLMOpsModel ServingInference APIsGPU optimization

il y a 1 jour

Candidature rapide

Le meilleur endroit pour trouver votre prochaine opportunité

© 2026. Tous droits réservés.

Talents

Trouver un job

Créer un profil

Solutions et outils