Poste : ingénieur de plateforme principal
Lieu de travail : 100 % à distance (horaires de la zone horaire de lEst des États-Unis)
Type de poste : temps plein
Présentation de lentreprise
Jeune entreprise en IA en pleine croissance, ayant levé des fonds en série A et rentable, active dans le domaine de lintelligence appliquée à la construction depuis plus de 7 ans.
À propos du poste
Nous recherchons un ingénieur de plateforme principal pour diriger lévolution de linfrastructure, des systèmes de déploiement et des fondements opérationnels de notre plateforme destimation par IA à fort impact.
Il sagit dun poste dingénierie pratique, impliquant un haut degré de responsabilité. En travaillant directement avec le chef de lingénierie et en collaborant avec les équipes de backend, de frontend et dapprentissage automatique, vous concevrez et mettrez en uvre une plateforme multi-locataires sécurisée et évolutive, moderniserez le traitement asynchrone des tâches, automatiserez les pipelines de livraison, améliorerez lobservabilité et optimiserez la fiabilité de la production sur AWS et GCP.
Si vous vous épanouissez dans un environnement agile où vous pouvez influencer lorientation technique, assumer la responsabilité des résultats de bout en bout et voir vos décisions mises en uvre rapidement sans friction bureaucratique, ce poste est fait pour vous.
Objectifs de réussite (résultats de la première année) :
- Architecture de la plateforme : Mettre en place une plateforme multi-locataires sécurisée et évolutive, dotée dune isolation robuste des locataires et de limites de contexte explicites (base de données, stockage, file dattente, service).
- Systèmes asynchrones : Mettre en place un traitement des tâches géré, fiable et observable (p. ex., AWS SQS) avec des files dattente de messages perdus, des travailleurs idempotents et une équité par locataire.
- Automatisation de la livraison : Créer un processus de déploiement CI/CD reproductible comprenant une validation automatisée, des tests de fumée, des contrôles de fonctionnalités et des retours en arrière sécurisés.
- Observabilité et fiabilité : Mettre en place une observabilité de bout en bout (journaux, métriques, traçage, alertes) liée à limpact réel sur les clients et établir des objectifs de fiabilité clairs.
- Sécurité et efficacité du nuage : Effectuer la transition vers la fédération didentités des charges de travail et les jetons à durée de vie limitée, réduire le risque opérationnel et optimiser les dépenses multinuage (AWS + GCP) à laide de métriques dutilisation et de coûts.
- Responsabilité de lenvironnement de production : Renforcer les guides dintervention en cas dincident, les procédures de reprise après sinistre et les pratiques dinfrastructure en tant que code (Ansible/outils déclaratifs) qui sadaptent à léchelle sans surcoût inutile.
À propos de vous :
- Esprit dingénieur : Vous réfléchissez à lampleur des répercussions, aux modes de défaillance, au temps de reprise et à la stratégie de restauration avant dintervenir sur lenvironnement de production.
- Décideur pragmatique : Vous choisissez les technologies en fonction de leur maturité opérationnelle, des besoins de lentreprise et du coût total de possession et vous êtes capable de communiquer clairement vos décisions aux intervenants non techniques.
- Autonome et adaptable : Vous vous épanouissez dans des environnements dingénierie légers et en constante évolution. Vous gérez lambiguïté avec aisance et apportez des idées novatrices.
- Axé sur la croissance et la rétroaction : Très curieux et autonome, vous acceptez la rétroaction constructive avec sérénité et affinez continuellement votre savoir-faire.
- Partenaire collaboratif : Excellentes compétences en communication écrite et verbale; vous aimez travailler en binôme avec des ingénieurs en apprentissage automatique, en backend et en sécurité pour mettre au point des solutions fluides.
Exigences indispensables :
- Au moins 6 ans dexpérience en ingénierie de plateforme, en infrastructure, en DevOps, en SRE ou dans une discipline connexe.
- Expertise approfondie dAWS : Expérience pratique avancée dans les domaines du calcul, des réseaux, de lIAM, de S3, de linfrastructure de conteneurs et des services cloud gérés.
- Responsabilité des systèmes de production : Expérience avérée dans lexploitation denvironnements de conteneurs multiservices en production, le dépannage dincidents complexes en production et la gestion de bases de données de production (sauvegardes, réplication, migrations).
- Traitement asynchrone : Expérience en production avec des files dattente de messages gérées (p. ex. SQS, RabbitMQ, Pub/Sub) et les concepts fondamentaux (nouvelles tentatives, files dattente de messages perdus, contre-pression, idempotence).
- CI/CD et automatisation : Expérience dans la mise en place de pipelines automatisés de compilation, de test et de déploiement, ainsi que dans lutilisation de linfrastructure en tant que code (Ansible, Terraform, CloudFormation ou Pulumi).
- Compétences fondamentales : Solides compétences en Linux, Docker, en réseaux et en Python (capacité à lire, déboguer et modifier le code des applications et de linfrastructure).
- Migrations en production : Expérience avérée dans la refonte ou la migration dun système de production en service, tout en préservant la disponibilité pour les clients et lintégrité des données
Notre pile technologique :
- Services de base : Python, Flask, React 19, TypeScript
- Données et cache : MongoDB, Amazon DocumentDB, Redis
- Infrastructure et calcul : Docker/Compose, AWS (EC2, S3, EFS, ECR, IAM), Google Cloud Run et calcul sur GPU
- DevOps et outils : Ansible, Bitbucket Pipelines, Nginx, Auth0, Prometheus, Sentry
- IA/apprentissage automatique : services de vision par ordinateur basés sur Python utilisant des modèles de la famille YOLO
Pourquoi se joindre à nous ?
- Impact concret et grande autonomie : Relevez de véritables défis dévolutivité et dexploitation sur un produit dIA appliquée où vos décisions sont mises en production en quelques semaines, et non en quelques mois.
- Croissance rentable et stable : Joignez-vous à une équipe soutenue par un financement de série A et forte de sept années de croissance rentable et éprouvée.
- Flexibilité et autonomie : Profitez dun modèle de travail à distance à 100 % (heure de lEst) au sein dune équipe soudée et hautement compétente qui valorise la confiance, une communication claire et une discipline opérationnelle saine.
Veuillez envoyer votre CV en format Word à Gabriela Pineda-Perez à ladresse gabriela.pineda@quantum-qtr.com.
RECOMMANDEZ UNE PERSONNE EMBAUCHÉE POUR UN POSTE ET OBTENEZ UNE PRIME ! Pour plus d'informations, cliquez ici.
Numéro du permis CNESST : AP-2000414 et AR-2000415
Toutes les candidatures sont examinées par notre équipe de recrutement, et les décisions dembauche sont prises par des personnes. Nous pouvons également utiliser des outils dotés dintelligence artificielle pour soutenir certaines étapes du processus dexamen des candidatures.
...............................................................
Position: Senior Platform Engineer
Location: 100% Remote (Working EST Hours)
Job Type: Full-time
Company Overview
Fast-growing, Series A funded, profitable AI-tech startup operating in the construction intelligence space for over 7 years.
About the Role
We are seeking a Senior Platform Engineer to lead the evolution of the infrastructure, deployment systems, and operational foundations behind our high-impact AI estimation platform.
This is a hands-on, high-ownership engineering role. Working directly with the Head of Engineering and collaborating across backend, frontend, and ML teams, you will design and implement a secure, scalable multi-tenant platform, modernize asynchronous job processing, automate delivery pipelines, elevate observability, and optimize production reliability across AWS and GCP.
If you thrive in a nimble environment where you can influence technical direction, own outcomes end-to-end, and see your decisions deployed quickly without bureaucratic friction, this role is built for you.
What Success Looks Like (Year 1 Outcomes):
- Platform Architecture: Build a secure, scalable multi-tenant platform with robust tenant isolation and explicit context boundaries (database, storage, queue, service).
- Asynchronous Systems: Introduce managed, reliable, and observable job processing (e.g., AWS SQS) with dead-letter queues, idempotent workers, and per-tenant fairness.
- Delivery Automation: Create a repeatable CI/CD deployment process featuring automated validation, smoke testing, feature controls, and safe rollbacks.
- Observability & Reliability: Build end-to-end observability (logs, metrics, tracing, alerts) tied to real customer impact and establish clear reliability targets.
- Cloud Security & Efficiency: Transition to workload identity federation/short-lived tokens, reduce operational risk, and optimize multi-cloud spending (AWS + GCP) using usage/cost metrics.
- Production Ownership: Strengthen incident response playbooks, disaster recovery procedures, and infrastructure-as-code practices (Ansible/declarative tools) that scale without unnecessary overhead.
About You:
- Engineering Mindset: You think about blast radius, failure modes, recovery time, and rollback strategy before touching production.
- Pragmatic Decision-Maker: You choose technologies based on operational maturity, business needs, and total cost of ownershipand can communicate decisions clearly to non-technical stakeholders.
- Autonomous & Adaptable: You thrive in lightweight, evolving engineering environments. You navigate ambiguity gracefully and bring fresh ideas to the table.
- Growth & Feedback Oriented: Highly curious and self-driven, you take constructive feedback in stride and continuously refine your craft.
- Collaborative Partner: Excellent written and verbal communication skills; you enjoy pairing with ML, backend, and security engineers to build smooth solutions.
Must-Have Requirements:
- 6+ years of experience in Platform Engineering, Infrastructure, DevOps, SRE, or a related discipline.
- Deep AWS Expertise: Advanced hands-on experience across compute, networking, IAM, S3, container infrastructure, and managed cloud services.
- Production Systems Ownership: Proven track record running live multi-service container environments, troubleshooting complex production incidents, and managing production databases (backups, replication, migrations).
- Asynchronous Processing: Production experience with managed message queues (e.g., SQS, RabbitMQ, Pub/Sub) and core concepts (retries, dead-letter queues, backpressure, idempotency).
- CI/CD & Automation: Experience building automated build/test/deploy pipelines and utilizing Infrastructure-as-Code (Ansible, Terraform, CloudFormation, or Pulumi).
- Core Fundamentals: Strong Linux, Docker, networking, and Python skills (capable of reading, debugging, and modifying both application and infrastructure code).
- Production Migrations: Demonstrated experience re-architecting or migrating a live production system while maintaining customer availability and data integrity
Our Tech Stack:
- Core Services: Python, Flask, React 19, TypeScript
- Data & Cache: MongoDB, Amazon DocumentDB, Redis
- Infrastructure & Compute: Docker/Compose, AWS (EC2, S3, EFS, ECR, IAM), Google Cloud Run & GPU compute
- DevOps & Tooling: Ansible, Bitbucket Pipelines, Nginx, Auth0, Prometheus, Sentry
- AI/ML: Python-based computer vision services using YOLO-family models
Why Join Us?
- Real Impact & High Ownership: Solve real scaling and operational challenges on an applied AI product where your decisions reach production within weeks, not months.
- Profitable & Stable Growth: Work with a team backed by Series A funding and 7 years of proven, profitable growth.
- Flexibility & Autonomy: Enjoy a 100% remote working model (EST hours) on a close-knit, highly capable team that values trust, clear communication, and healthy operational discipline.
All applications are reviewed by our recruitment team, and hiring decisions are made by people. We may also use AI-enabled tools to support parts of the application review process.