LLM / Foundation Model Engineer
Build, fine-tune, and optimize large language models. Pre-training, post-training, RLHF, alignment.
74
Open Positions
Core Skills
Transformer ArchitecturesRLHFPost-trainingScaling LawsDistributed TrainingPyTorchDeepSpeedMegatron
Active Positions (50)
Senior ML Engineersenior
Recraft·London, UK
PyTorchDiffusion ModelsModel Fine-TuningModel ServingFoundation ModelsTransformer Architectures
Software engineer, generative AImid
Writer·San Francisco, CA
Large Language Models (LLMs)Retrieval-Augmented Generation (RAG)Agentic AIMulti-Agent SystemsModel Fine-TuningEvaluation Frameworks
Principal Software Engineer - Waymo Driver Post Trainingstaff
Waymo·Mountain View, CA, USA
Post-TrainingReinforcement LearningVision-Language Models (VLMs)Model Fine-TuningFoundation ModelsDistillation
Machine Learning Engineer Perception LLM/VLM (PhD, New Grad)mid
Waymo·Mountain View, CA USA; San Francisco, CA USA;
Vision-Language Models (VLMs)Large Language Models (LLMs)Pre-TrainingFoundation ModelsLong-Context ModelingPyTorch
Senior ML Engineer, LLM / VLM Distillationsenior
Waymo·Mountain View, CA, USA
LLM DistillationVision-Language Models (VLMs)Knowledge DistillationFoundation ModelsMultimodal AIPost-Training
Senior Research Scientist, Foundation Model (LLM/VLM)senior
Waymo·Mountain View, CA, USA; San Francisco, CA, USA
Foundation ModelsVision-Language Models (VLMs)Large Language Models (LLMs)JAXPost-TrainingDistillation
Tech Lead Manager, Foundation Modelssenior
Waymo·Mountain View, CA, USA ; Kirkland, WA, USA ; New York City, NY, USA
Foundation ModelsPre-TrainingPost-TrainingTransformer ArchitecturesSelf-Supervised LearningReinforcement Learning
Staff Software Engineer, AI Model Lifecyclestaff
Crusoe·San Francisco, CA - US
Model Fine-TuningLoRA / QLoRAReward ModelingRLHFDistillationDistributed Training
Senior Staff Software Engineer, AI Model Lifecyclesenior
Crusoe·San Francisco, CA - US
LoRA / QLoRAModel Fine-TuningDistillationReward ModelingReinforcement LearningLarge Language Models (LLMs)
Senior Director, AI Model Lifecyclesenior
Crusoe·San Francisco, CA - US
LoRA / QLoRAModel Fine-TuningReinforcement Learning from Human Feedback (RLHF)Reward ModelingDistillationDistributed Training
AI Research Engineer - Foundation Modelsmid
Helsing·Berlin; London; Munich; Paris
Foundation ModelsVision-Language Models (VLMs)Model Fine-TuningData CurationMultimodal AIPre-Training
Model Research, Optimization, and Trainingmid
Tenstorrent·Toronto, Ontario, Canada
PyTorchDistributed TrainingSpeculative DecodingLarge Language Models (LLMs)Inference OptimizationScaling Laws
Engineering Internship, Enrichment and Curationintern
Wayve·Sunnyvale
Foundation ModelsPre-TrainingPost-TrainingData CurationMultimodal AIVision-Language Models (VLMs)
Full Stack LLM Engineermid
Cerebras·Toronto, Ontario, Canada
Large Language Models (LLMs)Model ServingInference OptimizationTransformer ArchitecturesPyTorch
Applied Machine Learning Research Scientistmid
Cerebras·Sunnyvale CA or Toronto Canada
Pre-TrainingPost-TrainingReinforcement Learning from Human Feedback (RLHF)Model Fine-TuningDistributed TrainingEvaluation Frameworks
Lead Full Stack Machine Learning Engineersenior
Cerebras·Bengaluru, Karnataka, India
Reinforcement LearningModel ServingInference OptimizationTransformer ArchitecturesPyTorchDistributed Training
Principal ML Investigatorstaff
Cerebras·Sunnyvale, CA
Post-TrainingReinforcement Learning from Human Feedback (RLHF)Data CurationPre-TrainingScaling LawsDistillation
Researcher, Post Trainingmid
Lovable·Stockholm
Post-TrainingRLHFDirect Preference Optimization (DPO)Reward ModelingPyTorchJAX
Research Engineer - Environments, Data and Post-Trainingmid
Mercor·San Francisco
Post-TrainingGRPO (Group Relative Policy Optimization)Reward ModelingSynthetic Data GenerationEvaluation FrameworksRLHF
Research Engineer / Scientist, Post-training - Parismid
H Company·Hybrid Paris
Reinforcement Learning from Human Feedback (RLHF)Post-TrainingVision-Language Models (VLMs)Distributed TrainingAlignmentPyTorch
Research Engineer / Scientist, Post-training - Londonmid
H Company·Hybrid London
Reinforcement Learning from Human Feedback (RLHF)Post-TrainingVision-Language Models (VLMs)Distributed TrainingAlignmentPyTorch
Applied AI Researcher, Post-Trainingmid
Distyl AI·San Francisco
Post-TrainingDirect Preference Optimization (DPO)Reinforcement Learning from Human Feedback (RLHF)LoRA / QLoRAReward ModelingModel Fine-Tuning
Research Engineer / Research Scientist (Pre-training)mid
Ideogram·Toronto
Pre-TrainingDiffusion ModelsFoundation ModelsScaling LawsJAXPyTorch
Technical Program Manager, Science Operations, Codemanager
Mistral AI·Paris
Model Fine-TuningEvaluation FrameworksPost-TrainingAI-Assisted Code Generation
Senior Staff Software Engineer, TLMsenior
Waymo·Mountain View, CA, USA
Foundation ModelsMLOpsModel ServingDistributed TrainingEvaluation FrameworksData Curation
Research Engineer, Code RL (Reinforcement Learning)mid
Anthropic·San Francisco, CA | New York City, NY
Reinforcement Learning from Human Feedback (RLHF)Reward ModelingDistributed TrainingEvaluation FrameworksPyTorchAgentic AI
Research Engineer / Research Scientist, Post-Trainingmid
OpenAI·San Francisco
Reinforcement Learning from Human Feedback (RLHF)Post-TrainingGRPO (Group Relative Policy Optimization)Evaluation FrameworksReward ModelingModel Fine-Tuning
Software Engineer, Post-Training Researchmid
OpenAI·San Francisco
Post-TrainingEvaluation FrameworksRLHFModel Fine-TuningReward Modeling
Research Engineer, Codexmid
OpenAI·San Francisco
Large Language Models (LLMs)AI-Assisted Code GenerationAgentic AIInference OptimizationModel Fine-Tuning
Researcher, Computer Use - Agent Post-Trainingmid
OpenAI·San Francisco
Post-TrainingReinforcement LearningReward ModelingEvaluation FrameworksSynthetic Data GenerationAgentic AI
Researcher, Connectors - Agent Post-Trainingmid
OpenAI·San Francisco
Post-TrainingReinforcement LearningReward ModelingEvaluation FrameworksSynthetic Data GenerationTool-Use / Function Calling
Researcher, Artifacts - Agent Post-Trainingmid
OpenAI·San Francisco
Post-TrainingReinforcement LearningReward ModelingEvaluation FrameworksSynthetic Data GenerationRLHF
Researcher, Context - Agent Post-Trainingmid
OpenAI·San Francisco
Post-TrainingReinforcement LearningLong-Context ModelingReward ModelingEvaluation FrameworksScaling Laws
Researcher, Training - London mid
OpenAI·London, UK
Pre-TrainingTransformer ArchitecturesScaling LawsLong-Context ModelingFlashAttentionDistributed Training
Researcher, Agent Post-Training, API & Power-Usersmid
OpenAI·San Francisco
Post-TrainingReinforcement Learning from Human Feedback (RLHF)Direct Preference Optimization (DPO)Reward ModelingTool-Use / Function CallingEvaluation Frameworks
Researcher, Agent Post-Training, Personalitymid
OpenAI·San Francisco
Post-TrainingReinforcement Learning from Human Feedback (RLHF)Reward ModelingDirect Preference Optimization (DPO)Evaluation FrameworksSynthetic Data Generation
Research Scientist, Gemini Information Tasksmid
Google DeepMind·New York City, New York, US
Post-TrainingReinforcement LearningRetrieval-Augmented Generation (RAG)Reward ModelingEvaluation FrameworksTool-Use / Function Calling
Member of Technical Staff - Post-Training and RLstaff
xAI·Palo Alto, CA
Reinforcement Learning from Human Feedback (RLHF)Direct Preference Optimization (DPO)Reward ModelingReinforcement LearningPost-TrainingAI Alignment
Member of Technical Staff - Pre-Trainingstaff
xAI·Palo Alto, CA
Pre-TrainingScaling LawsDistributed TrainingFoundation ModelsMixture-of-Experts
Member of Technical Staff, Integration/RL Team (Research Engineer)staff
Cohere·Paris
Reinforcement Learning from Human Feedback (RLHF)Post-TrainingDistributed TrainingJAXPyTorchGRPO (Group Relative Policy Optimization)
Member of Technical Staff - Sovereign AIstaff
Cohere·Canada
Agentic AILarge Language Models (LLMs)Distributed TrainingFoundation ModelsPost-TrainingGPU Clusters
Manager of Technical Staff, Sovereign AIstaff
Cohere·Toronto
Large Language Models (LLMs)Foundation ModelsDistributed TrainingPyTorchScaling LawsPre-Training
Machine Learning Intern/Co-op (Fall, 2026)intern
Cohere·Canada
Large Language Models (LLMs)Distributed TrainingPyTorchJAXXLACUDA
Member of Technical Staff, Research EngineerstaffRemote
Runway·Remote
World ModelsFoundation ModelsPyTorchJAXDistributed TrainingPost-Training
Principal Research Scientist - AI Scaling & Optimizationstaff
Databricks·Mountain View, California; San Francisco, California
Scaling LawsDistributed TrainingPost-TrainingReinforcement LearningInference OptimizationPyTorch
Principal Research Scientist – Scalingstaff
Databricks·San Francisco, California
Scaling LawsDistributed TrainingPost-TrainingReinforcement LearningInference OptimizationPyTorch
Software Engineer, ML Research mid
Cursor·San Francisco
Distributed TrainingReinforcement LearningLarge Language Models (LLMs)PyTorchModel Fine-TuningSynthetic Data Generation
Research, Post-Trainingmid
Cognition (Devin)·San Francisco
Post-TrainingReinforcement Learning from Human Feedback (RLHF)Reward ModelingAlignmentDistributed TrainingEvaluation Frameworks
Research, Mid-Training mid
Cognition (Devin)·San Francisco
Pre-TrainingPost-TrainingSynthetic Data GenerationLong-Context ModelingData CurationScaling Laws
AI Scientist - Warsawmid
Mistral AI·Warsaw
PyTorchJAXRayDistributed TrainingMLOpsModel Fine-Tuning