Talent.com
NBCUniversal
Reinforcement Learning Engineer - Ingénieur(e) en apprentissage par renforcementNBCUniversal • Montréal, QC, CA
Reinforcement Learning Engineer - Ingénieur(e) en apprentissage par renforcement

Reinforcement Learning Engineer - Ingénieur(e) en apprentissage par renforcement

NBCUniversal • Montréal, QC, CA
30+ days ago
Job type
  • Full-time
Job description

Job Description

We are seeking a Reinforcement Learning Engineer with experience manipulating virtual environments to train autonomous agents. This role focuses on the design of robust simulation environments, reward structures, and policy architectures that can navigate complex, multi-sensor landscapes.

Key Responsibilities

  • Cross-Functional Coordination: Work with partner ML and Annotation engineers and TPMs to spec out data, simulation, and training requirements.
  • Environment Design: Build and maintain high-fidelity 2D/3D simulation environments (using tools like Unity, Unreal, or Isaac Sim) that serve as the training ground for RL agents.
  • Reward Engineering: Design and tune complex reward functions that align agent behavior with product goals and safety constraints.
  • Algorithm Implementation: Develop and optimize RL algorithms (, PPO, SAC, or Offline RL) capable of handling high-dimensional 3D observation spaces.
  • Sim-to-Real Strategy: Analyze the "reality gap" and implement domain randomization or adaptation techniques to ensure models perform reliably in real-world scenarios.

Nous sommes à la recherche d’un(e) ingénieur(e) en apprentissage par renforcement ayant de l’expérience dans la création et l’exploitation d’environnements virtuels pour l’entraînement d’agents autonomes. Ce rôle consiste à concevoir des environnements de simulation robustes, des structures de récompense et des architectures de politiques capables d’évoluer dans des contextes complexes et multi-capteurs.

Vous jouerez un rôle clé dans le rapprochement entre simulation et performance réelle en développant des systèmes RL évolutifs et en garantissant un comportement fiable des agents dans des conditions variées.

  • Collaboration interfonctionnelle : Travailler avec les ingénieurs ML, les équipes d’annotation et les TPM afin de définir les besoins en données, en simulation et en entraînement.
  • Conception d’environnements : Développer et maintenir des environnements de simulation 2D/3D à haute fidélité à l’aide d’outils tels que Unity, Unreal ou Isaac Sim.
  • Ingénierie des récompenses : Concevoir et optimiser des fonctions de récompense afin d’aligner le comportement des agents avec les objectifs produit et les contraintes de sécurité.
  • Implémentation d’algorithmes : Développer et optimiser des algorithmes d’apprentissage par renforcement (ex. : PPO, SAC, RL hors ligne) adaptés à des espaces d’observation à haute dimension.
  • Stratégie sim-to-real : Réduire l’écart entre simulation et réalité à l’aide de techniques comme la randomisation de domaine et l’adaptation afin d’assurer des performances fiables en conditions réelles.

Qualifications

  • Education: Graduate degree (Master’s or PhD) in Robotics, Computer Science, AI, or a related field with a focus on Reinforcement Learning, Imitation Learning, or other Online Machine Learning fields.
  • Professional Experience: Proven experience as an RL Engineer or Research Engineer in a fast-paced environment.
  • Industry Context: Prior experience in industries with complex multi-disciplinary teams such as robotics, smart grids, precision agriculture, game development, or aerospace.

Technical Proficiency:

  • Core Tools: Fluency with Python, Git, and the Unix shell.
  • RL Frameworks: Deep familiarity with frameworks like Ray Rllib, Stable Baselines3, or CleanRL.
  • Physics & 3D Engines: Experience with physics engines (MuJoCo, Bullet) or 3D game engines.
  • Ecosystem: Familiarity with collaborative tools such as Jira/Confluence, Slack, a Git server, and an experiment tracking framework.

Attributes:

  • Strong Mathematical Background: Essential for understanding Markov Decision Processes (MDPs) and gradient-based optimization.
  • High Attention to Detail: Critical for debugging non-deterministic agent behaviors and ensuring environment parity.
  • Formation : Maîtrise ou Doctorat en robotique, informatique, intelligence artificielle ou domaine connexe avec une spécialisation en apprentissage par renforcement, imitation ou apprentissage en ligne.
  • Expérience : Expérience démontrée en tant qu’ingénieur(e) en apprentissage par renforcement ou en recherche dans un environnement dynamique.
  • Contexte industriel : Une expérience dans des secteurs multidisciplinaires tels que la robotique, les réseaux intelligents, l’agriculture de précision, les jeux vidéo ou l’aérospatiale est fortement valorisée.

Compétences techniques

  • Outils principaux : Excellente maîtrise de Python, Git et des environnements Unix.
  • Frameworks RL : Expérience avec des frameworks tels que Ray RLlib, Stable Baselines3 ou CleanRL.
  • Physique et simulation : Expérience avec des moteurs physiques (MuJoCo, Bullet) ou des environnements de simulation 3D.
  • Écosystème : Familiarité avec des outils collaboratifs tels que Jira, Confluence, Slack, les workflows Git et les plateformes de suivi d’expériences.

Qualités recherchées

  • Solides bases mathématiques : Bonne compréhension des processus de décision de Markov (MDP) et de l’optimisation basée sur le gradient.
  • Rigueur et précision : Capacité à déboguer des systèmes non déterministes et à assurer la cohérence et la précision des environnements de simulation.

Additional Information

As part of our selection process, external candidates may be required to attend an in-person interview with an NBCUniversal employee at one of our locations prior to a hiring decision. NBCUniversal's policy is to provide equal employment opportunities to all applicants and employees without regard to race, color, religion, creed, gender, gender identity or expression, age, national origin or ancestry, citizenship, disability, sexual orientation, marital status, pregnancy, veteran status, membership in the uniformed services, genetic information, or any other basis protected by applicable law.

If you are a qualified individual with a disability or a disabled veteran and require support throughout the application and/or recruitment process as a result of your disability, you have the right to request a reasonable accommodation. You can submit your request to AccessibilityS.

Create a job alert for this search

Reinforcement Learning Engineer - Ingénieur(e) en apprentissage par renforcement • Montréal, QC, CA

Similar jobs

Chercheur.se en apprentissage automatique sénior

LawZeroMontreal (administrative region), QC, CA
Full-time

ML) sénior pour rejoindre notre équipe travaillant sur un agenda de recherche novateur en sécurité de l'IA.Dans ce rôle, vous concevrez et implémenterez des modèles de ML innovants visant à résoudr... Show more

 • Promoted

PLM Deployment, Testing & Training Analyst

Morson Talent (Canada & USA)Laval, QC, CA
Full-time

A leading recruitment agency is seeking a PLM Systems Support & Deployment Analyst for a contract role in Laval, Quebec.This position involves bridging technical teams and front-line support, ensur... Show more

 • Promoted

Analog/Mixed-Signal IC Design Co-Op/Intern (Summer 2026) / Stage/Co-Op en Conception de CI Anal[...]

Cadence Design SystemsMount Royal, Montreal (administrative region), CA
Permanent

Co‑Op – Analog/ Mixed‑Signal IC Design.The co‑op student will be given the responsibility of utilizing and learning analog/mixed‑signal IC design and simulation techniques to investigate selected t... Show more

 • Promoted

Premier chercheur, Apprentissage machine- FR

RBCMontreal-Ouest
Full-time

RBC Borealis est à la recherche d’un premier chercheur en apprentissage machine, enthousiaste et désireux de jouer un rôle de premier plan dans le domaine des technologies d’apprentissage machine, ... Show more

 • Promoted

Leader Technique Dynamics 365 F&O — Développement & Mentorat

BDO CanadaMontreal (administrative region), QC, CA
Full-time

Une société de conseil recherche un développeur expert en Dynamics 365 pour concevoir des systèmes adaptés aux besoins des clients.Le candidat idéal aura plus de 5 ans d’expérience, une solide maît... Show more

 • Promoted

Analyste de données (Machine Learning)

Veriforce CanadaMontreal
Full-time

En tant que membre de l'équipe BI d'Veriforce, vous jouerez un rôle clé dans la conception, le développement et la maintenance de notre plateforme de visualisation BI, tout en contribuant à la mise... Show more

 • Promoted

Senior Machine Learning Engineer - Computer Vision

CitylogixMontreal
Full-time

Citylogix is a data and analytics company transforming how transportation infrastructure is managed.We build intelligent GIS and asset management solutions that help municipalities and engineering ... Show more

 • Promoted

Expert Bilingue en Apprentissage chez IPEX

IPEX by AliaxisMontreal
Full-time

Devenez Expert en Apprentissage chez IPEX à Montréal, où vous intégrerez votre maîtrise du français et de l'anglais dans la conception de programmes innovants.Ce poste hybride offre l'opportunité d... Show more

 • Promoted

Analyste de Risque en Génie à Distance

AtkinsRéalisMontreal (administrative region), QC, CA
Full-time

Intégrez AtkinsRéalis en tant qu'Analyste de Risque en Génie et contribuez à des projets innovants avec une approche d'affaires hybride.Vous serez acteur de la gestion des risques à travers diverse... Show more

 • Promoted

Expert en Déploiement chez TEHORA

TEHORA inc.Montreal
Full-time

Faites avancer votre carrière chez TEHORA en tant qu'Expert en Déploiement.Participez à la formation des utilisateurs tout en travaillant dans un environnement hybride stimulé par la créativité à Q... Show more

 • Promoted

Directeur(trice) de l’apprentissage et du développement

Henley & Partners - The Firm of Global Citizens®Montreal
Full-time

Pourquoi choisir Henley & Partners.Impact mondial : Joignez-vous à une entreprise qui fait une réelle différence dans la vie des gens.Notre travail permet à des particuliers et à des familles d’éla... Show more

 • Promoted

(CAN) Lead Specialist, Facilitator, Learning and Development

Walmart CanadaLaval (administrative region), QC, CA

Le spécialiste principal, animation – Académie Walmart, offre des formations complètes, en virtuel et en présentiel, axées sur des contenus stratégiques, le leadership et des sujets complexes.Ce po... Show more

 • Promoted

ML Engineer - Tabular Predictions & LLMs (Hybrid)

AkkodisMontreal, Montreal (administrative region), CA
Full-time

Une entreprise de technologie du voyage recherche un ingénieur en apprentissage automatique à Montréal.La mission inclut le développement de modèles de prévision basés sur des données tabulaires et... Show more

 • Promoted

Montreal Reinforcement Learning Engineer Role

Appit LLCMontreal
Full-time

Join APPIT Software Solutions in Montreal as a Reinforcement Learning Engineer, designing innovative systems that drive AI optimization and autonomous decision-making.Leverage your skills in cuttin... Show more

 • Promoted

Expert en Intégrations TI à Terrebonne

Keolis Commuter ServicesMontreal (Administrative Region), Terrebonne
Full-time

À la recherche d'un rôle d'Analyste en Intégrations TI à Terrebonne? Ce poste allie vos compétences techniques et votre passion pour l'optimisation des systèmes d'affaires.Dans ce rôle dynamique, v... Show more

 • Promoted

Conseiller·ère, design réfrigération

Metro Inc.Terrebonne, Lanaudière, Canada
Full-time

Le la titulaire du poste collabore aux tâches de l'équipe mécanique et énergie du Québec de la Division Ingénierie et Construction.Ce poste met l'accent sur la compétence dans les tâches du de la c... Show more

 • Promoted

Analyste en Didacticiels / Courseware Analyst

OPAL-RT TECHNOLOGIESMontreal
Full-time

À Propos D’OPAL-RT Technologies.Imaginez travailler pour une entreprise qui compte parmi ses clients la NASA, Bombardier, ABB, EMBRAER, MIT, GE, Ford, GM, NREL, RIVIAN et Hydro-Québec! OPAL-RT s’es... Show more

 • Promoted

Leader en Solutions Techniques – RTL

Réseau de transport de LongueuilLongueuil, Montérégie, CA
Full-time

Rejoignez Le Réseau de transport de l’agglomération de Longueuil en tant que Leader en Solutions Techniques.Ce poste clé sera décisif pour améliorer la souplesse et l'efficacité de nos services par... Show more

 • Promoted

Responsable technique de Salesforce, Technologies informatiques

RichterMontreal
Full-time

Responsable technique de Salesforce, Technologies informatiques.Responsable technique de Salesforce, Technologies informatiques.Richter est un Bureau Familial | d’Affaires qui fournit des conseils ... Show more

 • Promoted

Responsable Release Salesforce — Delivery & Gouvernance

Intelli5Montreal
Full-time

Une entreprise du secteur des assurances recherche un Release Manager Salesforce pour rejoindre une équipe dynamique.Vous serez responsable de la stratégie de branches, de la gestion des dépendance... Show more