Edward Beeching
I am a Machine Learning Research Scientist at
Hugging Face . My recent work focuses on
reinforcement learning and post-training for language models, open reasoning systems,
and efficient training infrastructure.
Previously, I completed a PhD at INSA Lyon with the
INRIA CHROMA team, where I studied
deep reinforcement learning for planning, navigation, and embodied agents.
Email
Hugging Face
GitHub
LinkedIn
Twitter
Research & Writing
My research spans language-model post-training, reasoning, embodied learning, and
reinforcement learning. Publications and technical articles are listed together below.
2026
Amine Dirhoussi, Quentin Gallouédec, Kashif Rasul, Lewis Tunstall, Edward Beeching , Albert Villanova del Moral, Leandro von Werra, Sergio Paniego
Hugging Face Blog, May 27, 2026
article
Joel Niklaus, Atsuki Yamaguchi, Michal Štefánik, Guilherme Penedo, Hynek Kydlíček, Elie Bakouch, Lewis Tunstall, Edward Beeching , et al.
arXiv, 2026
paper
A controlled study of design choices for generating synthetic language-model pretraining data.
LM-Provers, Yuxiao Qu, Amrith Setlur, Jasper Dekoninck, Edward Beeching , Jia Li, Ian Wu, Lewis Tunstall, Aviral Kumar
arXiv, 2026
paper models & data
An open 4B model and training pipeline for difficult Olympiad-level mathematical proofs.
Amine Dirhoussi, Quentin Gallouédec, Kashif Rasul, Lewis Tunstall, Edward Beeching , Albert Villanova del Moral, Nouamane Tazi, Leandro von Werra, Sergio Paniego
Hugging Face Blog, March 10, 2026
article
2025
Elie Bakouch, Carlos Miguel Patiño, Anton Lozhkov, Edward Beeching , et al.
Hugging Face Blog, July 8, 2025
article
Ben Burtenshaw, Vaibhav Srivastav, Lewis Tunstall, Edward Beeching , Yagil Burowski
Hugging Face Blog, March 20, 2025
article
Guilherme Penedo, Lewis Tunstall, Anton Lozhkov, Hynek Kydlíček, Edward Beeching , Loubna Ben Allal, Quentin Gallouédec, Leandro von Werra, Agustín Piqueres Lajarín, Nathan Habib
Hugging Face Blog, March 11, 2025
article
Yuxiao Qu, Matthew Y. R. Yang, Amrith Setlur, Lewis Tunstall, Edward Beeching , Ruslan Salakhutdinov, Aviral Kumar
ICML, 2025
paper project
A meta-reinforcement learning view of training models to use test-time compute efficiently.
Tom P. Freeman, Edward Beeching , Sam Craft, et al.
European Archives of Psychiatry and Clinical Neuroscience, 2025
article open access
Leandro von Werra, Lewis Tunstall, Quentin Gallouédec, Guilherme Penedo, Edward Beeching , Anton Lozhkov, Brigitte Tousignant, Daniel van Strien
Hugging Face Blog, February 2, 2025
article
2024
Lewis Tunstall*, Edward Beeching* , Nathan Lambert, Nazneen Rajani, Kashif Rasul, et al.
Conference on Language Modeling (COLM), 2024
paper model
Distilling supervised and preference signals to align smaller open language models.
Yann Fleureau, Jia Li, Edward Beeching , Lewis Tunstall, Ben Lipkin, Roman Soletskyi, Shengyi Costa Huang, Kashif Rasul
Hugging Face Blog, July 11, 2024
article
Quentin Gallouédec, Edward Beeching , Clément Romac, Thomas Wolf
Hugging Face Blog, April 22, 2024
article
Merve, Edward Beeching
Hugging Face Blog, April 11, 2024
article
Quentin Gallouédec, Edward Beeching , Clément Romac, Emmanuel Dellandréa
arXiv, 2024
paper article code
A single Transformer agent trained across text, vision, robotics, and gaming tasks.
Shengyi Costa Huang, Lewis Tunstall, Edward Beeching , Leandro von Werra, Omar Sanseviero, Kashif Rasul, Thomas Wolf
Hugging Face Blog, February 1, 2024
article
Kashif Rasul, Edward Beeching , Lewis Tunstall, Leandro von Werra, Omar Sanseviero
Hugging Face Blog, January 18, 2024
article
2023
Nazneen Rajani, Nathan Lambert, Sheon Han, Edward Beeching , et al.
Hugging Face Blog, June 12, 2023
article
Lewis Tunstall, Nathan Lambert, Nazneen Rajani, Edward Beeching , Teven Le Scao, Sheon Han, Philipp Schmid, Leandro von Werra, Alexander Rush
Hugging Face Blog, May 9, 2023
article
Edward Beeching , Kashif Rasul, Younes Belkada, Lewis Tunstall, Leandro von Werra, Nazneen Rajani, Nathan Lambert
Hugging Face Blog, April 5, 2023
article
Edward Beeching , Younes Belkada, Leandro von Werra, Sourab Mangrulkar, Lewis Tunstall, Kashif Rasul
Hugging Face Blog, March 9, 2023
article
2022
Edward Beeching , Thomas Simonini
Hugging Face Blog, September 8, 2022
article
Edward Beeching , Thomas Simonini
Hugging Face Blog, March 28, 2022
article
2021
Edward Beeching , Jilles Dibangoye, Olivier Simonin, Christian Wolf
AAAI Workshop on Reinforcement Learning in Games, 2021
paper project code
An open interface connecting the Godot game engine to common reinforcement-learning frameworks.
Edward Beeching , Maxim Peter, Philippe Marcotte, Jilles Dibangoye, Olivier Simonin, Joshua Romoff, Christian Wolf
AAAI Workshop on Reinforcement Learning in Games, 2021
paper project code
2020
Edward Beeching , Jilles Dibangoye, Olivier Simonin, Christian Wolf
ECCV, 2020 — Spotlight
paper project code
Learning-based planning over uncertain graphs with visual node features.
Edward Beeching , Jilles Dibangoye, Olivier Simonin, Christian Wolf
ECML-PKDD, 2020
paper project code
A spatially structured neural memory for embodied reinforcement-learning agents.
Edward Beeching , Christian Wolf, Jilles Dibangoye, Olivier Simonin
ICPR, 2020
paper project code
2014
C. E. Jones, J. I. Selvage, G. Rønholt, J. Wright, S. Naumann, E. E. Beeching , et al.
76th EAGE Conference and Exhibition, 2014
paper
Open Source
Post-training models with supervised fine-tuning, preference optimization, and reinforcement learning.
An open reproduction of reasoning-model training recipes and datasets.
Open models and 860,000 competition-mathematics problem-solution pairs.
A generalist Transformer agent for text, vision, robotics, and game environments.
Tools for training reinforcement-learning agents inside the Godot game engine.
PhD Thesis
University of Lyon / INSA Lyon, 2022. Supervised by Olivier Simonin, Christian Wolf, and Jilles Dibangoye.
Embodied Agent Demos
VIDEO
Behaviors learned with Godot RL Agents.
VIDEO
Image-goal navigation in a 3D scan without a provided map.
VIDEO
An agent learning to collect an ordered sequence of objects.
Inspired by the clean, publication-first tradition of academic homepages. Last updated August 2026.