Expertises
il y a 1 jour
Candidature rapide
Partagez cette opportunité
Partagez cette opportunité à quelqu’un de votre réseau :
✓ Offrez-lui un boost de visibilité auprès du client.
✓ Aidez vos contacts à trouver leur prochain job.
Information importante
Type de contrat:
Freelance / Contrat
Taux journalier :
~600
Cette offre est à 0% de commission 🎉Localisation :
Paris, France
Mode de travail :
Hybride
Publié le :
7 octobre 2026
Le besoin
Contexte
Dans le cadre du développement et de l’industrialisation d’une plateforme dédiée à l’IA agentique, le consultant intégrera une équipe en charge du socle technique permettant de déployer, superviser et exploiter des agents IA en production.
L’objectif de la mission est de garantir la fiabilité, la disponibilité, la performance, la sécurité et l’exploitabilité de cette plateforme, tout en assurant sa portabilité entre différents environnements.
Missions
- Garantir la robustesse et l’exploitabilité d’un environnement Kubernetes de production.
- Mettre en œuvre les pratiques SRE adaptées à une plateforme critique.
- Définir et suivre les SLI/SLO de la plateforme.
- Garantir la disponibilité, la capacité, la résilience, la sauvegarde et la reprise.
- Mettre en place une observabilité de bout en bout des services et composants.
- Industrialiser les mécanismes de supervision, d’alerting et de remédiation.
- Construire les dashboards opérationnels et les indicateurs de suivi.
- Industrialiser les manifests, charts et pipelines de déploiement.
- Garantir la compatibilité des déploiements entre les différents environnements.
- Mettre en œuvre les pratiques CI/CD et GitOps.
- Contribuer à la sécurisation des workloads, des secrets, des accès API et des politiques réseau.
- Garantir la portabilité et l’agnosticité de l’infrastructure.
- Mettre en place et exploiter une chaîne OpenTelemetry pour les traces, métriques et logs.
- Construire les systèmes d’alerting associés aux services et aux agents.
- Préparer les mécanismes nécessaires aux analyses post-incident et à l’amélioration continue.
- Formaliser les procédures de mise en production, rollback, gestion des incidents et exploitation.
- Rédiger et maintenir les runbooks d’exploitation.
- Accompagner les équipes dans l’adoption des pratiques SRE et d’exploitation.
- Participer aux instances de suivi et de pilotage.
- Assurer la mise à jour des outils de suivi et de la documentation technique.
- Interventions ponctuelles en horaires décalés lors des mises en production ou opérations sensibles.
- Déplacements occasionnels possibles.
Livrables attendus
- Plateforme agentique industrialisée et exploitable en production.
- Définition et suivi des SLI/SLO.
- Dashboards de supervision et de pilotage opérationnel.
- Systèmes d’alerting.
- Chaîne d’observabilité basée sur OpenTelemetry.
- Runbooks d’exploitation.
- Procédures de mise en production et de rollback.
- Documentation d’architecture technique.
- Documentation des pratiques d’exploitation et de supervision.
- Outils et tableaux de suivi régulièrement mis à jour.
Environnement technique
- Kubernetes
- SRE
- OpenTelemetry
- Grafana
- CI/CD
- GitOps
- Linux
- Cloud
- Réseaux
- Sécurité des plateformes
- Python et/ou Go
- Manifests et charts de déploiement
- Pipelines multi-environnements
- Gestion des secrets
- Policies réseau
- APIs
- Observabilité : traces, métriques et logs
- Environnements de production critiques
Informations générales
- Poste : SRE
- Expérience requise : Plus de 7 ans
Profil recherché
Plus de 7 ans d'expérience
Expérience significative sur Kubernetes en environnement de production
Maîtrise de l’exploitation de plateformes critiques et des pratiques SRE
Compétences en définition, suivi et amélioration des SLI/SLO
Conception de solutions d’observabilité avec OpenTelemetry
Mise en place de dashboards et d’alerting avec Grafana
Pratiques CI/CD et GitOps
Connaissances en Linux, réseaux et sécurité des plateformes
Expérience avec les environnements cloud et architectures agnostiques
Développement de scripts ou outils d’automatisation en Python et/ou Go
Industrialisation des déploiements et gestion dans des environnements multiples
Gestion des incidents, des mises en production et des rollback
Documentation technique et formalisation de procédures d’exploitation
Automatisation et amélioration continue des pratiques d’exploitation
Une expérience sur des plateformes liées à l’IA, à l’IA générative ou aux architectures agentiques est un atout
D'autres offres idéales pour vous !
Ces entreprises cherchent également d'excellents profils
Teksystems
Site Reliability Engineer (SRE) (H/F)
Freelance
92130 Issy-les-Moulineaux, France
Hybride
Expertises
il y a 6 mois
Candidature rapide
Whub
Site Reliability Engineer (SRE) (H/F)
500€/jour - 650€/jour
Freelance
Lille, France
Sur site
Expertises
il y a 4 mois
Candidature rapide
Salutech
Consultant Expert Intelligence Artificielle - IT
Freelance
Paris, France
Sur site, Hybride
Expertises
il y a 1 jour
Candidature rapide