[ECCV2024] Modèle de langage multimodal ancré avec tokenisation visuelle localisée
Interagissez avec un grand modèle de langage qui comprend le contexte visuel et peut générer des réponses détaillées basées sur des images.
Revendiquez sa page : indexée quel que soit son rang, traduite en six langues, et enrichie de vos propres mots.
Recevez une alerte par e-mail à sa prochaine version ou quand il décolle — ne ratez plus rien.
Gratuit · sans carte · désinscription à tout moment[ECCV2024] Modèle de langage multimodal ancré avec tokenisation visuelle localisée
Groma compte 586 étoiles sur GitHub. Il a été forké 44 fois. Groma est écrit principalement en Python. Il est développé activement depuis 2024. Groma est disponible sous licence Apache-2.0. Ses principaux thèmes sont : foundation-models, grounding, large-language-models, llama.
[ECCV2024] Modèle de langage multimodal ancré avec tokenisation visuelle localisée
Groma est un projet open source. Il est distribué sous licence Apache-2.0.
Oui. Groma est gratuit et open source — vous pouvez l'utiliser, le modifier et l'héberger vous-même.
Groma est disponible sous licence Apache-2.0.
Groma est écrit principalement en Python.
Ajoutez ce badge en direct à votre README — vos étoiles GitHub et votre classement dans le répertoire, actualisés quotidiennement.
[](https://olud.ai/project/foundationvision-groma.html)
Mesuré à partir des topics GitHub communs aux deux projets, pondérés par leur rareté.