Apprentissage par renforcement via auto-distillation (SDPO)
Entraînez des modèles AI à apprendre à partir de retours détaillés au lieu de simples scores finaux, améliorant ainsi leurs performances dans des tâches comme le codage et les mathématiques.
Revendiquez sa page : indexée quel que soit son rang, traduite en six langues, et enrichie de vos propres mots.
Recevez une alerte par e-mail à sa prochaine version ou quand il décolle — ne ratez plus rien.
Gratuit · sans carte · désinscription à tout momentApprentissage par renforcement via auto-distillation (SDPO)
SDPO compte 1k étoiles sur GitHub. Il a été forké 118 fois. SDPO est écrit principalement en Python. Il est développé activement depuis 2026. SDPO est disponible sous licence Apache-2.0. Ses principaux thèmes sont : distillation, llm, reasoning, rl.
Apprentissage par renforcement via auto-distillation (SDPO)
SDPO est un projet open source. Il est distribué sous licence Apache-2.0.
Oui. SDPO est gratuit et open source — vous pouvez l'utiliser, le modifier et l'héberger vous-même.
SDPO est disponible sous licence Apache-2.0.
SDPO est écrit principalement en Python.
Ajoutez ce badge en direct à votre README — vos étoiles GitHub et votre classement dans le répertoire, actualisés quotidiennement.
[](https://olud.ai/project/lasgroup-sdpo.html)
Mesuré à partir des topics GitHub communs aux deux projets, pondérés par leur rareté.