[ICLR2025, ICML2025, NeurIPS2025 Spotlight] La Atención Cuantizada logra una aceleración de 2-5x en comparación con FlashAttention, sin perder métricas de extremo a extremo en modelos de lenguaje, imagen y video.
Acelera el procesamiento de modelos de IA sin perder precisión utilizando técnicas de atención eficientes en tus proyectos.
Reivindica su pagina: indexada sea cual sea su posicion, traducida a seis idiomas y enriquecida con tus propias palabras.
Recibe una alerta por correo en su próximo lanzamiento o cuando despegue — no te pierdas nada.
Gratis · sin tarjeta · cancela cuando quieras[ICLR2025, ICML2025, NeurIPS2025 Spotlight] La Atención Cuantizada logra una aceleración de 2-5x en comparación con FlashAttention, sin perder métricas de extremo a extremo en modelos de lenguaje, imagen y video.
SageAttention tiene 3.5k estrellas en GitHub. Se ha bifurcado 447 veces. SageAttention está escrito principalmente en Cuda. Se desarrolla activamente desde 2024. SageAttention está disponible bajo la licencia Apache-2.0. Sus temas principales son: attention, cuda, efficient-attention, inference-acceleration.
[ICLR2025, ICML2025, NeurIPS2025 Spotlight] La Atención Cuantizada logra una aceleración de 2-5x en comparación con FlashAttention, sin perder métricas de extremo a extremo en modelos de lenguaje, imagen y video.
SageAttention es un proyecto de código abierto. Se distribuye bajo la licencia Apache-2.0.
Sí. SageAttention es gratuito y de código abierto: puedes usarlo, modificarlo y alojarlo tú mismo.
SageAttention está disponible bajo la licencia Apache-2.0.
SageAttention está escrito principalmente en Cuda.
Agrega este distintivo en vivo a tu README — tus estrellas de GitHub y rango en el directorio, actualizados diariamente.
[](https://olud.ai/project/thu-ml-sageattention.html)