Home Progetti Groma
Groma

Groma

di FoundationVision · GitHub

[ECCV2024] Modello di linguaggio multimodale ancorato con tokenizzazione visiva localizzata

Visualizza su GitHub
⭐ Stelle
🍴 Fork
📜 Licenza
Uso commerciale consentito
📅 Creato
🔄 Ultimo commit
🏷️ Categoria
💻 Lingua
🖥️ Auto-ospitato
Probabile
Mantieni questo progetto?

Rivendica la sua pagina: indicizzata qualunque sia il rango, tradotta in sei lingue e arricchita con le tue parole.

Rivendica questa pagina →
Groma — GitHub preview card
📈 Storia delle stelle
586585
2026-07-202026-07-29
📈 Segui Groma

Ricevi un avviso via email alla prossima release o quando decolla — non perderti nulla.

Gratis · senza carta · disdici quando vuoi
Ricevi avvisi via email →
📄 Informazioni

[ECCV2024] Modello di linguaggio multimodale ancorato con tokenizzazione visiva localizzata

Groma ha 585 stelle su GitHub. È stato forkato 44 volte. Groma è scritto principalmente in Python. È in sviluppo attivo dal 2024. Groma è disponibile con licenza Apache-2.0. I suoi temi principali sono: foundation-models, grounding, large-language-models, llama.

Frequently asked questions

Che cos'è Groma?

[ECCV2024] Modello di linguaggio multimodale ancorato con tokenizzazione visiva localizzata

Groma è open source?

Groma è un progetto open source. È rilasciato con licenza Apache-2.0.

Groma è gratuito?

Sì. Groma è gratuito e open source: puoi usarlo, modificarlo e ospitarlo autonomamente.

Con quale licenza è Groma?

Groma è disponibile con licenza Apache-2.0.

In quale linguaggio è scritto Groma?

Groma è scritto principalmente in Python.

🏅 Manutentore di questo progetto?
OpenSourceAI badge — Groma

Aggiungi questo badge live al tuo README — le tue stelle GitHub e il ranking della directory, aggiornati quotidianamente.

[![OpenSourceAI](https://opensourceai.tech/badge.php?tool=foundationvision-groma)](https://opensourceai.tech/project/foundationvision-groma.html)
Altre opzioni di badge →
🧬 Condivide il DNA con🧬 Vedi la mappa del DNA →
Thinking-with-Visual-Primitives
Snapshot archiviato di Thinking-with-Visual-Primitives
273 · deepseek
condividegroundingvision-language-model
LLaVA
[NeurIPS'23 Oral] Visual Instruction Tuning (LLaVA) costruito per capacità a livello GPT-4V e o…
25k · chatbot
condividellama2vision-language-model
NExT-GPT
Codice e modelli per l'articolo ICML 2024, NExT-GPT: Modello di Linguaggio Multimodale Any-to-A…
3.6k · chatgpt
condividemllmfoundation-models
OPERA
[CVPR 2024 Highlight] OPERA: Alleviare l'allucinazione nei Modelli di Linguaggio di Grandi Dime…
412 · chatbot
condividevision-language-modelllama
Awesome-Multimodal-LLM-Autonomous-Driving
[WACV 2024 Survey Paper] Modelli di linguaggio multimodali per la guida autonoma
313 · autonomous-car
condividevision-language-modelfoundation-models
R1-VL
R1-VL: Apprendere a ragionare con modelli di linguaggio multimodali di grandi dimensioni tramit…
352 · mllm
condividemllmvision-language-model
Olympus
[CVPR 2025 Highlight] Codice ufficiale per "Olympus: A Universal Task Router for Computer Visio…
428 · chatbot
condividevision-language-modelfoundation-models
tokenize-anything
[ECCV 2024] Tokenizza Qualsiasi Cosa tramite Prompting
601 · foundation-models
condividefoundation-modelsmultimodal
VoxPoser
VoxPoser: Mappe di Valore 3D Componibili per Manipolazione Robotica con Modelli di Linguaggio
826 · embodied-ai
condividevision-language-modelfoundation-models
mllm
LLM multimodale veloce su dispositivi mobili
1.6k · ai
condividellamamultimodal

Misurato dai topic GitHub comuni a entrambi i progetti, ponderati per la loro rarita.