Accueil Projets Groma
Groma
Python

Groma

[ECCV2024] Modèle de langage multimodal ancré avec tokenisation visuelle localisée

par FoundationVision · GitHub
Étoiles
Forks
Licence
Créé
Dernier commit
Langue
Probable
Auto-hébergeable
foundation-modelsgroundinglarge-language-modelsApache-2.0PythonAuto-hébergeable
Voir sur GitHub
En termes simples

Interagissez avec un grand modèle de langage qui comprend le contexte visuel et peut générer des réponses détaillées basées sur des images.

Vous maintenez ce projet ?

Revendiquez sa page : indexée quel que soit son rang, traduite en six langues, et enrichie de vos propres mots.

Revendiquer cette page →
Groma — GitHub preview card
📈 Historique des étoiles
586585
2026-07-202026-08-31
📈 Suivez Groma

Recevez une alerte par e-mail à sa prochaine version ou quand il décolle — ne ratez plus rien.

Gratuit · sans carte · désinscription à tout moment
Recevoir des alertes e-mail →
📄 À propos

[ECCV2024] Modèle de langage multimodal ancré avec tokenisation visuelle localisée

Groma compte 586 étoiles sur GitHub. Il a été forké 44 fois. Groma est écrit principalement en Python. Il est développé activement depuis 2024. Groma est disponible sous licence Apache-2.0. Ses principaux thèmes sont : foundation-models, grounding, large-language-models, llama.

Frequently asked questions

Qu'est-ce que Groma ?

[ECCV2024] Modèle de langage multimodal ancré avec tokenisation visuelle localisée

Groma est-il open source ?

Groma est un projet open source. Il est distribué sous licence Apache-2.0.

Groma est-il gratuit ?

Oui. Groma est gratuit et open source — vous pouvez l'utiliser, le modifier et l'héberger vous-même.

Sous quelle licence est Groma ?

Groma est disponible sous licence Apache-2.0.

Dans quel langage Groma est-il écrit ?

Groma est écrit principalement en Python.

🏅 Mainteneur de ce projet ?
olud.ai badge — Groma

Ajoutez ce badge en direct à votre README — vos étoiles GitHub et votre classement dans le répertoire, actualisés quotidiennement.

[![olud.ai](https://olud.ai/badge.php?tool=foundationvision-groma)](https://olud.ai/project/foundationvision-groma.html)
Plus d'options de badge →
🧬 Partage son ADN avec🧬 Voir la cartographie ADN →
Thinking-with-Visual-Primitives
Archived snapshot of Thinking-with-Visual-Primitives
276 · deepseek
partagegroundingvision-language-model
NExT-GPT
Code et modèles pour le papier ICML 2024, NExT-GPT : Modèle de langage multimodal de n'importe…
3.6k · chatgpt
partagemllmfoundation-models
Awesome-Reasoning-Foundation-Models
✨✨Derniers articles et benchmarks en raisonnement avec des modèles de base
656 · foundation-models
partagefoundation-modelsmultimodal
Awesome-Multimodal-LLM-Autonomous-Driving
[WACV 2024 Article de synthèse] Modèles de langage multimodaux pour la conduite autonome
311 · autonomous-car
partagevision-language-modelfoundation-models
mPLUG-DocOwl
mPLUG-DocOwl : Modèle de langage multimodal modularisé pour la compréhension de documents
2.4k · chart-understanding
partagemllmmultimodal
lag-llama
Lag-Llama : Vers des modèles de fondation pour la prévision de séries temporelles probabilistes…
1.6k · forecasting
partagefoundation-modelsllama
VoxPoser
VoxPoser : Cartes de valeur 3D composables pour la manipulation robotique avec des modèles de l…
833 · embodied-ai
partagevision-language-modelfoundation-models
ONE-PEACE
Un modèle de représentation général à travers les modalités de vision, audio et langage. Articl…
1.1k · audio-language
partagefoundation-modelsmultimodal
tokenize-anything
[ECCV 2024] Tokenize Anything via Prompting
601 · foundation-models
partagefoundation-modelsmultimodal
mllm
LLM multimodal rapide sur appareils mobiles
1.6k · ai
partagellamamultimodal

Mesuré à partir des topics GitHub communs aux deux projets, pondérés par leur rareté.