Accueil Projets Groma
Groma

Groma

par FoundationVision · GitHub

[ECCV2024] Modèle de langage multimodal ancré avec tokenisation visuelle localisée

Voir sur GitHub
⭐ Étoiles
🍴 Forks
📜 Licence
Utilisation commerciale autorisée
📅 Créé
🔄 Dernier commit
🏷️ Catégorie
💻 Langue
🖥️ Auto-hébergeable
Probable
Vous maintenez ce projet ?

Revendiquez sa page : indexée quel que soit son rang, traduite en six langues, et enrichie de vos propres mots.

Revendiquer cette page →
Groma — GitHub preview card
📈 Historique des étoiles
586585
2026-07-202026-07-29
📈 Suivez Groma

Recevez une alerte par e-mail à sa prochaine version ou quand il décolle — ne ratez plus rien.

Gratuit · sans carte · désinscription à tout moment
Recevoir des alertes e-mail →
📄 À propos

[ECCV2024] Modèle de langage multimodal ancré avec tokenisation visuelle localisée

Groma compte 585 étoiles sur GitHub. Il a été forké 44 fois. Groma est écrit principalement en Python. Il est développé activement depuis 2024. Groma est disponible sous licence Apache-2.0. Ses principaux thèmes sont : foundation-models, grounding, large-language-models, llama.

Frequently asked questions

Qu'est-ce que Groma ?

[ECCV2024] Modèle de langage multimodal ancré avec tokenisation visuelle localisée

Groma est-il open source ?

Groma est un projet open source. Il est distribué sous licence Apache-2.0.

Groma est-il gratuit ?

Oui. Groma est gratuit et open source — vous pouvez l'utiliser, le modifier et l'héberger vous-même.

Sous quelle licence est Groma ?

Groma est disponible sous licence Apache-2.0.

Dans quel langage Groma est-il écrit ?

Groma est écrit principalement en Python.

🏅 Mainteneur de ce projet ?
OpenSourceAI badge — Groma

Ajoutez ce badge en direct à votre README — vos étoiles GitHub et votre classement dans le répertoire, actualisés quotidiennement.

[![OpenSourceAI](https://opensourceai.tech/badge.php?tool=foundationvision-groma)](https://opensourceai.tech/project/foundationvision-groma.html)
Plus d'options de badge →
🧬 Partage son ADN avec🧬 Voir la cartographie ADN →
Thinking-with-Visual-Primitives
Instantané archivé de Thinking-with-Visual-Primitives
273 · deepseek
partagegroundingvision-language-model
LLaVA
[NeurIPS'23 Oral] Tuning d'instructions visuelles (LLaVA) construit pour des capacités de nivea…
25k · chatbot
partagellama2vision-language-model
NExT-GPT
Code et modèles pour le papier ICML 2024, NExT-GPT : Modèle de langage multimodal de n'importe…
3.6k · chatgpt
partagemllmfoundation-models
OPERA
[CVPR 2024 Highlight] OPERA : Atténuer l'hallucination dans les grands modèles de langage multi…
412 · chatbot
partagevision-language-modelllama
Awesome-Multimodal-LLM-Autonomous-Driving
[WACV 2024 Article de synthèse] Modèles de langage multimodaux pour la conduite autonome
313 · autonomous-car
partagevision-language-modelfoundation-models
R1-VL
R1-VL : Apprendre à raisonner avec des modèles de langage multimodaux via l'optimisation de pol…
352 · mllm
partagemllmvision-language-model
Olympus
[CVPR 2025 Highlight] Code officiel pour "Olympus: Un routeur de tâches universel pour les tâch…
428 · chatbot
partagevision-language-modelfoundation-models
tokenize-anything
[ECCV 2024] Tokenize Anything via Prompting
601 · foundation-models
partagefoundation-modelsmultimodal
VoxPoser
VoxPoser : Cartes de valeur 3D composables pour la manipulation robotique avec des modèles de l…
826 · embodied-ai
partagevision-language-modelfoundation-models
mllm
LLM multimodal rapide sur appareils mobiles
1.6k · ai
partagellamamultimodal

Mesuré à partir des topics GitHub communs aux deux projets, pondérés par leur rareté.