Home Progetti Groma
Groma
Python

Groma

[ECCV2024] Modello di linguaggio multimodale ancorato con tokenizzazione visiva localizzata

di FoundationVision · GitHub
Stelle
Fork
Licenza
Creato
Ultimo commit
Lingua
Probabile
Auto-ospitato
foundation-modelsgroundinglarge-language-modelsApache-2.0PythonAuto-ospitato
Visualizza su GitHub
In parole semplici

Interagisci con un modello di linguaggio di grandi dimensioni che comprende il contesto visivo e può generare risposte dettagliate basate su immagini.

Mantieni questo progetto?

Rivendica la sua pagina: indicizzata qualunque sia il rango, tradotta in sei lingue e arricchita con le tue parole.

Rivendica questa pagina →
Groma — GitHub preview card
📈 Storia delle stelle
586585
2026-07-202026-08-31
📈 Segui Groma

Ricevi un avviso via email alla prossima release o quando decolla — non perderti nulla.

Gratis · senza carta · disdici quando vuoi
Ricevi avvisi via email →
📄 Informazioni

[ECCV2024] Modello di linguaggio multimodale ancorato con tokenizzazione visiva localizzata

Groma ha 586 stelle su GitHub. È stato forkato 44 volte. Groma è scritto principalmente in Python. È in sviluppo attivo dal 2024. Groma è disponibile con licenza Apache-2.0. I suoi temi principali sono: foundation-models, grounding, large-language-models, llama.

Frequently asked questions

Che cos'è Groma?

[ECCV2024] Modello di linguaggio multimodale ancorato con tokenizzazione visiva localizzata

Groma è open source?

Groma è un progetto open source. È rilasciato con licenza Apache-2.0.

Groma è gratuito?

Sì. Groma è gratuito e open source: puoi usarlo, modificarlo e ospitarlo autonomamente.

Con quale licenza è Groma?

Groma è disponibile con licenza Apache-2.0.

In quale linguaggio è scritto Groma?

Groma è scritto principalmente in Python.

🏅 Manutentore di questo progetto?
olud.ai badge — Groma

Aggiungi questo badge live al tuo README — le tue stelle GitHub e il ranking della directory, aggiornati quotidianamente.

[![olud.ai](https://olud.ai/badge.php?tool=foundationvision-groma)](https://olud.ai/project/foundationvision-groma.html)
Altre opzioni di badge →
🧬 Condivide il DNA con🧬 Vedi la mappa del DNA →
Thinking-with-Visual-Primitives
Archived snapshot of Thinking-with-Visual-Primitives
276 · deepseek
condividegroundingvision-language-model
NExT-GPT
Codice e modelli per l'articolo ICML 2024, NExT-GPT: Modello di Linguaggio Multimodale Any-to-A…
3.6k · chatgpt
condividemllmfoundation-models
Awesome-Reasoning-Foundation-Models
✨✨Ultimi articoli e benchmark nel ragionamento con modelli di base
656 · foundation-models
condividefoundation-modelsmultimodal
Awesome-Multimodal-LLM-Autonomous-Driving
[WACV 2024 Survey Paper] Modelli di linguaggio multimodali per la guida autonoma
311 · autonomous-car
condividevision-language-modelfoundation-models
mPLUG-DocOwl
mPLUG-DocOwl: Modello di linguaggio multimodale modularizzato per la comprensione dei documenti
2.4k · chart-understanding
condividemllmmultimodal
lag-llama
Lag-Llama: Verso modelli fondamentali per la previsione probabilistica delle serie temporali
1.6k · forecasting
condividefoundation-modelsllama
VoxPoser
VoxPoser: Mappe di Valore 3D Componibili per Manipolazione Robotica con Modelli di Linguaggio
833 · embodied-ai
condividevision-language-modelfoundation-models
ONE-PEACE
Un modello di rappresentazione generale attraverso modalità visive, audio e linguistiche. Docum…
1.1k · audio-language
condividefoundation-modelsmultimodal
tokenize-anything
[ECCV 2024] Tokenizza Qualsiasi Cosa tramite Prompting
601 · foundation-models
condividefoundation-modelsmultimodal
mllm
LLM multimodale veloce su dispositivi mobili
1.6k · ai
condividellamamultimodal

Misurato dai topic GitHub comuni a entrambi i progetti, ponderati per la loro rarita.