[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention erreicht eine Beschleunigung von 2-5x im Vergleich zu FlashAttention, ohne die End-to-End-Metriken über Sprach-, Bild- und Videomodelle zu verlieren.
Beschleunigen Sie die Verarbeitung von KI-Modellen, ohne Genauigkeit zu verlieren, indem Sie effiziente Aufmerksamkeits-Techniken in Ihren Projekten verwenden.
Beanspruchen Sie die Seite: indexiert unabhangig vom Rang, in sechs Sprachen ubersetzt und mit Ihren eigenen Worten erganzt.
Erhalten Sie eine E-Mail-Benachrichtigung beim nächsten Release oder wenn es durchstartet.
Kostenlos · ohne Karte · jederzeit abbestellbar[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention erreicht eine Beschleunigung von 2-5x im Vergleich zu FlashAttention, ohne die End-to-End-Metriken über Sprach-, Bild- und Videomodelle zu verlieren.
SageAttention hat 3.5k Sterne auf GitHub. Es wurde 447-mal geforkt. SageAttention ist hauptsächlich in Cuda geschrieben. Es wird seit 2024 aktiv entwickelt. SageAttention ist unter der Apache-2.0-Lizenz verfügbar. Die Hauptthemen sind: attention, cuda, efficient-attention, inference-acceleration.
[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention erreicht eine Beschleunigung von 2-5x im Vergleich zu FlashAttention, ohne die End-to-End-Metriken über Sprach-, Bild- und Videomodelle zu verlieren.
SageAttention ist ein Open-Source-Projekt. Es wird unter der Apache-2.0-Lizenz veröffentlicht.
Ja. SageAttention ist kostenlos und Open Source — Sie können es nutzen, anpassen und selbst hosten.
SageAttention ist unter der Apache-2.0-Lizenz verfügbar.
SageAttention ist hauptsächlich in Cuda geschrieben.
Fügen Sie dieses Live-Abzeichen zu Ihrem README hinzu — Ihre GitHub-Sterne und Verzeichnisrang, täglich aktualisiert.
[](https://opensourceai.tech/project/thu-ml-sageattention.html)