Startseite Projekte Groma
Groma
Python

Groma

[ECCV2024] Grounded Multimodal Large Language Model mit lokalisierter visueller Tokenisierung

von FoundationVision · GitHub
Sterne
Forks
Erstellt
Letzter Commit
Sprache
Wahrscheinlich
Selbst gehostet
foundation-modelsgroundinglarge-language-modelsApache-2.0PythonSelbst gehostet
Auf GitHub ansehen
In einfachen Worten

Interagieren Sie mit einem großen Sprachmodell, das den visuellen Kontext versteht und detaillierte Antworten basierend auf Bildern generieren kann.

Betreuen Sie dieses Projekt?

Beanspruchen Sie die Seite: indexiert unabhangig vom Rang, in sechs Sprachen ubersetzt und mit Ihren eigenen Worten erganzt.

Diese Seite beanspruchen →
Groma — GitHub preview card
📈 Sternhistorie
586585
2026-07-202026-08-31
📈 Groma verfolgen

Erhalten Sie eine E-Mail-Benachrichtigung beim nächsten Release oder wenn es durchstartet.

Kostenlos · ohne Karte · jederzeit abbestellbar
E-Mail-Alerts erhalten →
📄 Über

[ECCV2024] Grounded Multimodal Large Language Model mit lokalisierter visueller Tokenisierung

Groma hat 586 Sterne auf GitHub. Es wurde 44-mal geforkt. Groma ist hauptsächlich in Python geschrieben. Es wird seit 2024 aktiv entwickelt. Groma ist unter der Apache-2.0-Lizenz verfügbar. Die Hauptthemen sind: foundation-models, grounding, large-language-models, llama.

Frequently asked questions

Was ist Groma?

[ECCV2024] Grounded Multimodal Large Language Model mit lokalisierter visueller Tokenisierung

Ist Groma Open Source?

Groma ist ein Open-Source-Projekt. Es wird unter der Apache-2.0-Lizenz veröffentlicht.

Ist Groma kostenlos?

Ja. Groma ist kostenlos und Open Source — Sie können es nutzen, anpassen und selbst hosten.

Unter welcher Lizenz steht Groma?

Groma ist unter der Apache-2.0-Lizenz verfügbar.

In welcher Sprache ist Groma geschrieben?

Groma ist hauptsächlich in Python geschrieben.

🏅 Wartender dieses Projekts?
olud.ai badge — Groma

Fügen Sie dieses Live-Abzeichen zu Ihrem README hinzu — Ihre GitHub-Sterne und Verzeichnisrang, täglich aktualisiert.

[![olud.ai](https://olud.ai/badge.php?tool=foundationvision-groma)](https://olud.ai/project/foundationvision-groma.html)
Weitere Abzeichenoptionen →
🧬 Teilt DNA mit🧬 DNA-Karte ansehen →
Thinking-with-Visual-Primitives
Archived snapshot of Thinking-with-Visual-Primitives
276 · deepseek
teiltgroundingvision-language-model
NExT-GPT
Code und Modelle für das ICML 2024 Papier, NExT-GPT: Any-to-Any Multimodales großes Sprachmodel…
3.6k · chatgpt
teiltmllmfoundation-models
Awesome-Reasoning-Foundation-Models
✨✨Neueste Arbeiten und Benchmarks im Bereich des Denkens mit Grundmodellen
656 · foundation-models
teiltfoundation-modelsmultimodal
Awesome-Multimodal-LLM-Autonomous-Driving
[WACV 2024 Umfragepapier] Multimodale große Sprachmodelle für autonomes Fahren
311 · autonomous-car
teiltvision-language-modelfoundation-models
mPLUG-DocOwl
mPLUG-DocOwl: Modularisiertes multimodales großes Sprachmodell für das Dokumentenverständnis
2.4k · chart-understanding
teiltmllmmultimodal
lag-llama
Lag-Llama: Auf dem Weg zu Fundamentalen Modellen für probabilistische Zeitreihenprognosen.
1.6k · forecasting
teiltfoundation-modelsllama
VoxPoser
VoxPoser: Komponierbare 3D-Wertkarten für robotergestützte Manipulation mit Sprachmodellen
833 · embodied-ai
teiltvision-language-modelfoundation-models
ONE-PEACE
Ein allgemeines Repräsentationsmodell über Vision-, Audio- und Sprachmodalitäten hinweg. Papier…
1.1k · audio-language
teiltfoundation-modelsmultimodal
tokenize-anything
[ECCV 2024] Alles über Tokenisierung durch Aufforderung
601 · foundation-models
teiltfoundation-modelsmultimodal
mllm
Schnelles multimodales LLM auf mobilen Geräten.
1.6k · ai
teiltllamamultimodal

Ermittelt aus gemeinsamen GitHub-Topics beider Projekte, gewichtet nach ihrer Seltenheit.