[ECCV2024] Grounded Multimodal Large Language Model mit lokalisierter visueller Tokenisierung
Interagieren Sie mit einem großen Sprachmodell, das den visuellen Kontext versteht und detaillierte Antworten basierend auf Bildern generieren kann.
Beanspruchen Sie die Seite: indexiert unabhangig vom Rang, in sechs Sprachen ubersetzt und mit Ihren eigenen Worten erganzt.
Erhalten Sie eine E-Mail-Benachrichtigung beim nächsten Release oder wenn es durchstartet.
Kostenlos · ohne Karte · jederzeit abbestellbar[ECCV2024] Grounded Multimodal Large Language Model mit lokalisierter visueller Tokenisierung
Groma hat 586 Sterne auf GitHub. Es wurde 44-mal geforkt. Groma ist hauptsächlich in Python geschrieben. Es wird seit 2024 aktiv entwickelt. Groma ist unter der Apache-2.0-Lizenz verfügbar. Die Hauptthemen sind: foundation-models, grounding, large-language-models, llama.
[ECCV2024] Grounded Multimodal Large Language Model mit lokalisierter visueller Tokenisierung
Groma ist ein Open-Source-Projekt. Es wird unter der Apache-2.0-Lizenz veröffentlicht.
Ja. Groma ist kostenlos und Open Source — Sie können es nutzen, anpassen und selbst hosten.
Groma ist unter der Apache-2.0-Lizenz verfügbar.
Groma ist hauptsächlich in Python geschrieben.
Fügen Sie dieses Live-Abzeichen zu Ihrem README hinzu — Ihre GitHub-Sterne und Verzeichnisrang, täglich aktualisiert.
[](https://olud.ai/project/foundationvision-groma.html)
Ermittelt aus gemeinsamen GitHub-Topics beider Projekte, gewichtet nach ihrer Seltenheit.