Ingénieur de plateforme / Platform Engineer

no. de réf.
1002878
type
à distance
emplacement
Montréal, QC
salaire
$130000 - $150000
statut
permanent

Poste : ingénieur de plateforme principal
Lieu de travail : 100 % à distance (horaires de la zone horaire de l’Est des États-Unis)
Type de poste : temps plein

Présentation de l’entreprise

Jeune entreprise en IA en pleine croissance, ayant levé des fonds en série A et rentable, active dans le domaine de l’intelligence appliquée à la construction depuis plus de 7 ans.


À propos du poste

Nous recherchons un ingénieur de plateforme principal pour diriger l’évolution de l’infrastructure, des systèmes de déploiement et des fondements opérationnels de notre plateforme d’estimation par IA à fort impact.


Il s’agit d’un poste d’ingénierie pratique, impliquant un haut degré de responsabilité. En travaillant directement avec le chef de l’ingénierie et en collaborant avec les équipes de backend, de frontend et d’apprentissage automatique, vous concevrez et mettrez en œuvre une plateforme multi-locataires sécurisée et évolutive, moderniserez le traitement asynchrone des tâches, automatiserez les pipelines de livraison, améliorerez l’observabilité et optimiserez la fiabilité de la production sur AWS et GCP.

Si vous vous épanouissez dans un environnement agile où vous pouvez influencer l’orientation technique, assumer la responsabilité des résultats de bout en bout et voir vos décisions mises en œuvre rapidement sans friction bureaucratique, ce poste est fait pour vous.

Objectifs de réussite (résultats de la première année) :

- Architecture de la plateforme : Mettre en place une plateforme multi-locataires sécurisée et évolutive, dotée d’une isolation robuste des locataires et de limites de contexte explicites (base de données, stockage, file d’attente, service).

- Systèmes asynchrones : Mettre en place un traitement des tâches géré, fiable et observable (p. ex., AWS SQS) avec des files d’attente de messages perdus, des travailleurs idempotents et une équité par locataire.
- Automatisation de la livraison : Créer un processus de déploiement CI/CD reproductible comprenant une validation automatisée, des tests de fumée, des contrôles de fonctionnalités et des retours en arrière sécurisés.
- Observabilité et fiabilité : Mettre en place une observabilité de bout en bout (journaux, métriques, traçage, alertes) liée à l’impact réel sur les clients et établir des objectifs de fiabilité clairs.
- Sécurité et efficacité du nuage : Effectuer la transition vers la fédération d’identités des charges de travail et les jetons à durée de vie limitée, réduire le risque opérationnel et optimiser les dépenses multinuage (AWS + GCP) à l’aide de métriques d’utilisation et de coûts.
- Responsabilité de l’environnement de production : Renforcer les guides d’intervention en cas d’incident, les procédures de reprise après sinistre et les pratiques d’infrastructure en tant que code (Ansible/outils déclaratifs) qui s’adaptent à l’échelle sans surcoût inutile.

À propos de vous :

- Esprit d’ingénieur : Vous réfléchissez à l’ampleur des répercussions, aux modes de défaillance, au temps de reprise et à la stratégie de restauration avant d’intervenir sur l’environnement de production.

- Décideur pragmatique : Vous choisissez les technologies en fonction de leur maturité opérationnelle, des besoins de l’entreprise et du coût total de possession — et vous êtes capable de communiquer clairement vos décisions aux intervenants non techniques.
- Autonome et adaptable : Vous vous épanouissez dans des environnements d’ingénierie légers et en constante évolution. Vous gérez l’ambiguïté avec aisance et apportez des idées novatrices.
- Axé sur la croissance et la rétroaction : Très curieux et autonome, vous acceptez la rétroaction constructive avec sérénité et affinez continuellement votre savoir-faire.
- Partenaire collaboratif : Excellentes compétences en communication écrite et verbale; vous aimez travailler en binôme avec des ingénieurs en apprentissage automatique, en backend et en sécurité pour mettre au point des solutions fluides.

Exigences indispensables :

- Au moins 6 ans d’expérience en ingénierie de plateforme, en infrastructure, en DevOps, en SRE ou dans une discipline connexe.

- Expertise approfondie d’AWS : Expérience pratique avancée dans les domaines du calcul, des réseaux, de l’IAM, de S3, de l’infrastructure de conteneurs et des services cloud gérés.
- Responsabilité des systèmes de production : Expérience avérée dans l’exploitation d’environnements de conteneurs multiservices en production, le dépannage d’incidents complexes en production et la gestion de bases de données de production (sauvegardes, réplication, migrations).
- Traitement asynchrone : Expérience en production avec des files d’attente de messages gérées (p. ex. SQS, RabbitMQ, Pub/Sub) et les concepts fondamentaux (nouvelles tentatives, files d’attente de messages perdus, contre-pression, idempotence).
- CI/CD et automatisation : Expérience dans la mise en place de pipelines automatisés de compilation, de test et de déploiement, ainsi que dans l’utilisation de l’infrastructure en tant que code (Ansible, Terraform, CloudFormation ou Pulumi).
- Compétences fondamentales : Solides compétences en Linux, Docker, en réseaux et en Python (capacité à lire, déboguer et modifier le code des applications et de l’infrastructure).
- Migrations en production : Expérience avérée dans la refonte ou la migration d’un système de production en service, tout en préservant la disponibilité pour les clients et l’intégrité des données

Notre pile technologique :

- Services de base : Python, Flask, React 19, TypeScript

- Données et cache : MongoDB, Amazon DocumentDB, Redis
- Infrastructure et calcul : Docker/Compose, AWS (EC2, S3, EFS, ECR, IAM), Google Cloud Run et calcul sur GPU
- DevOps et outils : Ansible, Bitbucket Pipelines, Nginx, Auth0, Prometheus, Sentry
- IA/apprentissage automatique : services de vision par ordinateur basés sur Python utilisant des modèles de la famille YOLO

Pourquoi se joindre à nous ?

- Impact concret et grande autonomie : Relevez de véritables défis d’évolutivité et d’exploitation sur un produit d’IA appliquée où vos décisions sont mises en production en quelques semaines, et non en quelques mois.

- Croissance rentable et stable : Joignez-vous à une équipe soutenue par un financement de série A et forte de sept années de croissance rentable et éprouvée.
- Flexibilité et autonomie : Profitez d’un modèle de travail à distance à 100 % (heure de l’Est) au sein d’une équipe soudée et hautement compétente qui valorise la confiance, une communication claire et une discipline opérationnelle saine.

Veuillez envoyer votre CV en format Word à Gabriela Pineda-Perez à l’adresse gabriela.pineda@quantum-qtr.com.

RECOMMANDEZ UNE PERSONNE EMBAUCHÉE POUR UN POSTE ET OBTENEZ UNE PRIME ! Pour plus d'informations, cliquez ici.

Numéro du permis CNESST : AP-2000414 et AR-2000415

Toutes les candidatures sont examinées par notre équipe de recrutement, et les décisions d’embauche sont prises par des personnes. Nous pouvons également utiliser des outils dotés d’intelligence artificielle pour soutenir certaines étapes du processus d’examen des candidatures.


...............................................................


Position:
Senior Platform Engineer
Location: 100% Remote (Working EST Hours)
Job Type:
Full-time 

Company Overview

Fast-growing, Series A funded, profitable AI-tech startup operating in the construction intelligence space for over 7 years.

About the Role

We are seeking a Senior Platform Engineer to lead the evolution of the infrastructure, deployment systems, and operational foundations behind our high-impact AI estimation platform.

This is a hands-on, high-ownership engineering role. Working directly with the Head of Engineering and collaborating across backend, frontend, and ML teams, you will design and implement a secure, scalable multi-tenant platform, modernize asynchronous job processing, automate delivery pipelines, elevate observability, and optimize production reliability across AWS and GCP.

If you thrive in a nimble environment where you can influence technical direction, own outcomes end-to-end, and see your decisions deployed quickly without bureaucratic friction, this role is built for you.

What Success Looks Like (Year 1 Outcomes):

- Platform Architecture: Build a secure, scalable multi-tenant platform with robust tenant isolation and explicit context boundaries (database, storage, queue, service).
- Asynchronous Systems: Introduce managed, reliable, and observable job processing (e.g., AWS SQS) with dead-letter queues, idempotent workers, and per-tenant fairness.

- Delivery Automation: Create a repeatable CI/CD deployment process featuring automated validation, smoke testing, feature controls, and safe rollbacks.
- Observability & Reliability: Build end-to-end observability (logs, metrics, tracing, alerts) tied to real customer impact and establish clear reliability targets.
- Cloud Security & Efficiency: Transition to workload identity federation/short-lived tokens, reduce operational risk, and optimize multi-cloud spending (AWS + GCP) using usage/cost metrics.
- Production Ownership: Strengthen incident response playbooks, disaster recovery procedures, and infrastructure-as-code practices (Ansible/declarative tools) that scale without unnecessary overhead.

About You:

- Engineering Mindset: You think about blast radius, failure modes, recovery time, and rollback strategy before touching production.
- Pragmatic Decision-Maker: You choose technologies based on operational maturity, business needs, and total cost of ownership—and can communicate decisions clearly to non-technical stakeholders.

- Autonomous & Adaptable: You thrive in lightweight, evolving engineering environments. You navigate ambiguity gracefully and bring fresh ideas to the table.
- Growth & Feedback Oriented: Highly curious and self-driven, you take constructive feedback in stride and continuously refine your craft.
- Collaborative Partner: Excellent written and verbal communication skills; you enjoy pairing with ML, backend, and security engineers to build smooth solutions.

Must-Have Requirements:

- 6+ years of experience in Platform Engineering, Infrastructure, DevOps, SRE, or a related discipline.
- Deep AWS Expertise: Advanced hands-on experience across compute, networking, IAM, S3, container infrastructure, and managed cloud services.

- Production Systems Ownership: Proven track record running live multi-service container environments, troubleshooting complex production incidents, and managing production databases (backups, replication, migrations).
- Asynchronous Processing: Production experience with managed message queues (e.g., SQS, RabbitMQ, Pub/Sub) and core concepts (retries, dead-letter queues, backpressure, idempotency).
- CI/CD & Automation: Experience building automated build/test/deploy pipelines and utilizing Infrastructure-as-Code (Ansible, Terraform, CloudFormation, or Pulumi).
- Core Fundamentals: Strong Linux, Docker, networking, and Python skills (capable of reading, debugging, and modifying both application and infrastructure code).
- Production Migrations: Demonstrated experience re-architecting or migrating a live production system while maintaining customer availability and data integrity

Our Tech Stack:

- Core Services: Python, Flask, React 19, TypeScript

- Data & Cache: MongoDB, Amazon DocumentDB, Redis
- Infrastructure & Compute: Docker/Compose, AWS (EC2, S3, EFS, ECR, IAM), Google Cloud Run & GPU compute
- DevOps & Tooling: Ansible, Bitbucket Pipelines, Nginx, Auth0, Prometheus, Sentry
- AI/ML: Python-based computer vision services using YOLO-family models

Why Join Us?

- Real Impact & High Ownership: Solve real scaling and operational challenges on an applied AI product where your decisions reach production within weeks, not months.
- Profitable & Stable Growth: Work with a team backed by Series A funding and 7 years of proven, profitable growth.

- Flexibility & Autonomy: Enjoy a 100% remote working model (EST hours) on a close-knit, highly capable team that values trust, clear communication, and healthy operational discipline.

Please send your resume in Word format to Gabriela Pineda-Perez at gabriela.pineda@quantum-qtr.com.

REFER A NEW HIRE AND EARN A CASH BONUS! For details, click here.

CNESST permit numbers:  AP-2000414 & AR-2000415

All applications are reviewed by our recruitment team, and hiring decisions are made by people. We may also use AI-enabled tools to support parts of the application review process.

postuler dès maintement
contactez-nous
Gabriela Pineda-Perez
Gabriela Pineda-Perez
Spécialiste en recrutement

postulez maintenant

Vous pensez que ce poste correspond parfaitement à vos qualifications ? N'hésitez pas à télécharger votre CV.