Tech Ops Engineer
Description
Scientific Games
Scientific Games is the global leader in lottery games, sports betting and technology, and the partner of choice for government lotteries. From cutting-edge backend systems to exciting entertainment experiences and trailblazing retail and digital solutions, we elevate play every day. We push game designs to the next level and are pioneers in data analytics and iLottery. Built on a foundation of trusted partnerships, Scientific Games combines relentless innovation, legendary performance, and unwavering security to responsibly propel the global lottery industry ever forward.
Position Summary
Description du poste
L'ingénieur en opérations techniques assure le soutien de niveau 2 pour la production, le soutien à la mise en œuvre et l'ingénierie de la fiabilité des plateformes de loterie et de services interactifs. Ce poste garantit des opérations stables, sécurisées, observables et bien documentées dans des environnements Linux, Windows, de bases de données, d'applications, de réseau et adaptés au cloud.
Ce profil modernisé met l'accent sur les pratiques DevOps et de fiabilité des sites : opérations axées sur l'automatisation, prise en charge des déploiements CI/CD, infrastructure en tant que code, déploiements contrôlés, observabilité, gestion des incidents, gestion de la configuration, hygiène de sécurité, ainsi que les opérations sur AWS ou en cloud hybride, le cas échéant.
Ce poste peut être comblé à Montréal et/ou à Winnipeg, selon les besoins de l’organisation et le lieu de résidence des candidats retenus.
Responsabilités clés
-
Assurer le soutien technique de niveau 2 pour les plateformes de transactions en temps réel, notamment le triage des incidents, le dépannage et la coordination des escalades avec le niveau 3, le développement, l'assurance qualité, les fournisseurs et les opérations client.
-
Assurer le soutien des opérations de garde 24 heures sur 24, 7 jours sur 7, des fenêtres de maintenance planifiée, des nouvelles mises en œuvre, des refontes de systèmes, de l'analyse des performances, des tests d'intégration, des tests de reprise après sinistre et des activités de basculement sur place.
-
Installer, configurer, appliquer des correctifs, sécuriser et gérer le cycle de vie des serveurs Linux et Windows, en mettant l'accent sur les environnements Ubuntu LTS et Red Hat Enterprise Linux (RHEL).
-
Automatisez les tâches opérationnelles à l'aide de Bash, Python, PowerShell, Ansible, Terraform, SQL, CloudFormation ou d'outils équivalents afin de réduire les tâches manuelles, d'uniformiser les environnements et d'améliorer la fiabilité.
-
Prise en charge des opérations sur AWS ou en cloud hybride, le cas échéant, notamment EC2, RDS/Aurora PostgreSQL, S3, IAM, VPC, les groupes de sécurité, les équilibreurs de charge, Route 53, CloudWatch, Systems Manager, KMS et Secrets Manager.
-
Soutenir les activités liées à l'intégration continue et au déploiement continu (CI/CD) ainsi qu'à l'ingénierie des versions, notamment la préparation au déploiement, la validation des builds et des paquets, la mise en place des configurations, les concepts « blue/green » ou « canary », la planification des retours en arrière et la vérification post-déploiement.
-
Surveiller l'état des systèmes et des bases de données, l'utilisation des serveurs, les certificats, le flux des transactions, les files d'attente et les retards, les journaux, les indicateurs de performance du nuage et la disponibilité des services ; gérer les tableaux de bord, les alertes, les guides d'intervention et les procédures.
-
Effectuer des tâches de soutien liées à PostgreSQL/Postgres et aux SGBDR, telles que l'analyse des requêtes, la coordination des sauvegardes et des restaurations, le soutien à l'actualisation des données, le dépannage des connexions, l'évaluation de la capacité et la collecte de preuves.
-
Assurer la sécurité et l'hygiène opérationnelle grâce à l'application de correctifs, la correction des vulnérabilités, la gestion des certificats SSL/TLS, le principe du moindre privilège, la configuration sécurisée, les concepts de chiffrement et la mise à disposition de preuves d'audit.
-
Analyser les causes racines des problèmes de performance, des échecs de transaction, des anomalies de déploiement, des problèmes liés au nuage, au réseau ou aux serveurs, ainsi que des incidents récurrents ; communiquer les détails techniques et les mesures correctives.
Exigences du poste / Qualifications requises
-
Diplôme d'études collégiales dans un domaine connexe requis ; diplôme de premier cycle en informatique, en technologies de l'information, en génie ou dans un domaine connexe, un atout.
-
Au moins 5 ans d'expérience dans le soutien opérationnel, le DevOps, l'infrastructure, le soutien à la production, les opérations dans le nuage ou l'ingénierie de la fiabilité pour des plateformes transactionnelles à l'échelle de l'entreprise.
-
Une expérience dans les domaines des loteries, des jeux d'argent, des services financiers, du commerce électronique ou d'autres environnements transactionnels réglementés et à haute disponibilité constitue un atout majeur.
-
Maîtrise de l'administration de Windows Server et de Linux, en particulier Ubuntu LTS et Red Hat Enterprise Linux, notamment en matière de dépannage, d'application de correctifs, de renforcement de la sécurité et d'analyse des performances.
-
Connaissance de PostgreSQL/Postgres, RDS/Aurora PostgreSQL, SQL Server, MySQL, Oracle ou d’autres bases de données relationnelles similaires, y compris les concepts liés au dépannage SQL et à la maintenance opérationnelle.
-
Maîtrise de Python, Bash, PowerShell, SQL, Ansible, Terraform, CloudFormation ou d'outils similaires pour la création de scripting, le débogage, l'automatisation et la collecte de preuves.
-
Une expérience avec AWS est un atout, notamment avec EC2, RDS/Aurora, S3, IAM, VPC/groupes de sécurité, CloudWatch, Systems Manager, KMS, Secrets Manager, Route 53, l'équilibrage de charge, les instantanés, ainsi que les concepts de haute disponibilité (HA) et de reprise après sinistre (DR).
-
Expérience en virtualisation, stockage, réseaux, certificats SSL/TLS, gestion des identités et des accès (IAM), sécurité des systèmes, outils de surveillance et d’observabilité, intégration continue et déploiement continu (CI/CD), ainsi que gestion des changements en production.
##
Compétences et aptitudes
-
Solides compétences en analyse et en dépannage, avec la capacité d'identifier les problèmes au niveau des applications, des bases de données, du système d'exploitation, du réseau, du stockage, de la gestion des identités et des accès (IAM), des services en nuage et des pipelines de déploiement.
-
Une communication claire, tant à l'oral qu'à l'écrit, comprenant notamment des mises à jour concises sur l'état d'avancement, des notes d'incident, des guides d'intervention, des preuves de modification et de la documentation technique destinés à des publics tant opérationnels que techniques.
-
Un esprit de collaboration et la capacité de travailler en partenariat avec les équipes des opérations, du développement, de l'assurance qualité, des fournisseurs, de la sécurité et celles en contact direct avec la clientèle.
-
Une culture d'amélioration continue axée sur l'automatisation, la normalisation, la fiabilité, la sécurité, l'observabilité, la préparation au cloud et l'excellence opérationnelle.
-
Capacité avérée à diagnostiquer et à résoudre des problèmes techniques dans des environnements soumis à une forte pression et ayant un impact sur les clients, tout en respectant les procédures de gestion des changements et en garantissant la traçabilité.
-
Être à l'aise pour travailler au sein d'une équipe répartie sur plusieurs sites géographiques et pour expliquer des concepts techniques complexes à des intervenants non spécialisés.
##
Conditions de travail
-
Participe à un système de rotation des gardes 24 heures sur 24, 7 jours sur 7, et a