Aprendizaje por Refuerzo a través de Auto-Distilación (SDPO)
Entrena modelos de IA para aprender de comentarios detallados en lugar de solo puntajes finales, mejorando su rendimiento en tareas como programación y matemáticas.
Reivindica su pagina: indexada sea cual sea su posicion, traducida a seis idiomas y enriquecida con tus propias palabras.
Recibe una alerta por correo en su próximo lanzamiento o cuando despegue — no te pierdas nada.
Gratis · sin tarjeta · cancela cuando quierasAprendizaje por Refuerzo a través de Auto-Distilación (SDPO)
SDPO tiene 1k estrellas en GitHub. Se ha bifurcado 118 veces. SDPO está escrito principalmente en Python. Se desarrolla activamente desde 2026. SDPO está disponible bajo la licencia Apache-2.0. Sus temas principales son: distillation, llm, reasoning, rl.
Aprendizaje por Refuerzo a través de Auto-Distilación (SDPO)
SDPO es un proyecto de código abierto. Se distribuye bajo la licencia Apache-2.0.
Sí. SDPO es gratuito y de código abierto: puedes usarlo, modificarlo y alojarlo tú mismo.
SDPO está disponible bajo la licencia Apache-2.0.
SDPO está escrito principalmente en Python.
Agrega este distintivo en vivo a tu README — tus estrellas de GitHub y rango en el directorio, actualizados diariamente.
[](https://opensourceai.tech/project/lasgroup-sdpo.html)
Medido a partir de los topics de GitHub comunes a ambos proyectos, ponderados por su rareza.