Principal Applied AI Developer, Foundation Models Infrastructure
$153,000–$153,000 year
RemoteToronto, Ontario, Canada or Quebec, Canada
Job Summary
Define and drive technical strategy for Foundation Model ML Infrastructure capabilities within the Autodesk Machine Learning Platform. Lead the design and implementation of large-scale platform services supporting the full lifecycle of ML models, including training, inference, serving, evaluation, deployment, monitoring, and operations. Architect highly resilient, secure, observable, scalable, and cost-effective infrastructure for large-scale AI workloads using Kubernetes, Ray, SageMaker, and AWS. Build and evolve developer-facing APIs, tools, and self-service workflows to enable researchers and ML developers to move quickly and safely. Identify and prioritize high-impact technical problems aligned with product and platform strategy, translating ambiguous requirements into executable engineering plans. Drive reliability, scalability, performance, and cost improvements across training and inference workloads while establishing platform standards for production readiness, observability, and governance. Mentor senior developers, elevate engineering standards, and foster a culture of ownership and accountability.
Required Qualifications
- Licence ou master en informatique, génie informatique, apprentissage automatique, ou expérience pratique équivalente
- Au moins 8 ans d'expérience professionnelle en génie logiciel, incluant une expérience significative avec des systèmes d'infrastructure à grande échelle, natifs du cloud, distribués, de plateforme ou d'apprentissage automatique
- Expérience dans l'utilisation d'outils de développement assistés par l'IA, d'agents de codage et d'automatisation alimentée par l'IA pour améliorer la productivité technique, avec une compréhension pratique de la conception contextuelle, de la révision humaine, des tests, de l'utilisation sécurisée et de l'intégration dans les workflows des développeurs
- Solide expérience pratique de la conception, de la mise en place et de l'exploitation de services de niveau production prenant en charge l'entraînement, l'inférence, la mise à disposition, l'évaluation, le déploiement ou l'observabilité des modèles
- Solide expérience avec Kubernetes et les infrastructures cloud natives
- Expérience avec le calcul distribué, les infrastructures d'apprentissage automatique ou les technologies de mise à disposition de modèles telles que Ray, SageMaker, les plateformes d'entraînement distribuées, les plateformes de mise à disposition d'inférence ou des systèmes équivalents
- Capacité avérée à diriger des initiatives techniques complexes impliquant plusieurs équipes et à influencer l'orientation technique sans autorité hiérarchique directe
- Expérience dans la traduction d'exigences ambiguës issues de la recherche, des produits ou de l'entreprise en conceptions techniques concrètes et en plans d'ingénierie réalisables
- Solide expérience dans la conception et l'exploitation de systèmes de production résilients, sécurisés, observables et rentables, à l'aide de pratiques de CI/CD, de tests automatisés, d'infrastructure en tant que code, de surveillance, d'alertes et d'opérations de production
- Capacité avérée à encadrer les développeurs, à rehausser les normes d'ingénierie et à incarner une voix technique forte en faveur de l'excellence
- Solides compétences en communication écrite et orale, avec la capacité d'influencer les parties prenantes techniques et non techniques
Desired Qualifications
- Expérience des modèles avancés de développement assisté par l'IA, tels que l'ingénierie de harnais, l'orchestration d'agents de codage, les compétences, les MCP, la conception de prompts/contextes, les boucles d'évaluation et les workflows d'ingénierie réutilisables basés sur l'IA
- Expérience dans la création ou l'évolution de plateformes internes pour développeurs, de plateformes d'apprentissage automatique, d'infrastructures en libre-service ou d'API de plateformes utilisées par les chercheurs et les développeurs en apprentissage automatique
- Expérience dans le soutien à l'entraînement de modèles à grande échelle, au réglage fin, à l'inférence par lots, à l'inférence en temps réel, à la mise en service de modèles ou aux workflows de modèles de base
- Expérience dans la définition de l'architecture de plateforme, de la stratégie technique, des limites des services, des normes de fiabilité, des critères de maturité pour la production et des pratiques opérationnelles
- Expérience dans la conception de systèmes dotés de SLA ou de SLO clairs en matière de latence, de débit, de disponibilité, de fiabilité et de coût
- Connaissance de la gouvernance des modèles, de la gestion des versions des modèles, de la traçabilité, des workflows d'évaluation, de l'IA de confiance, de la sécurité, de la confidentialité et des pratiques d'IA responsable
- Expérience avérée dans la direction d'initiatives techniques inter-équipes, l'amélioration de la qualité de l'ingénierie et l'optimisation de la productivité des développeurs
- Expérience de collaboration avec des équipes de recherche en IA, des développeurs en apprentissage automatique, des équipes produit et des organisations de plateformes pour mettre en production des capacités d'IA appliquées
Hiring someone like this?
Get your role in front of qualified candidates on Sorce.