Inicio Proyectos Groma
Groma

Groma

por FoundationVision · GitHub

[ECCV2024] Modelo de Lenguaje Grande Multimodal Fundamentado con Tokenización Visual Localizada

Ver en GitHub
⭐ Estrellas
🍴 Ramas
📜 Licencia
Uso comercial permitido
📅 Creado
🔄 Último commit
🏷️ Categoría
💻 Lenguaje
🖥️ Autoalojable
Probable
¿Mantienes este proyecto?

Reivindica su pagina: indexada sea cual sea su posicion, traducida a seis idiomas y enriquecida con tus propias palabras.

Reivindicar esta pagina →
Groma — GitHub preview card
📈 Historial de estrellas
586585
2026-07-202026-07-29
📈 Sigue Groma

Recibe una alerta por correo en su próximo lanzamiento o cuando despegue — no te pierdas nada.

Gratis · sin tarjeta · cancela cuando quieras
Recibir alertas por email →
📄 Acerca de

[ECCV2024] Modelo de Lenguaje Grande Multimodal Fundamentado con Tokenización Visual Localizada

Groma tiene 585 estrellas en GitHub. Se ha bifurcado 44 veces. Groma está escrito principalmente en Python. Se desarrolla activamente desde 2024. Groma está disponible bajo la licencia Apache-2.0. Sus temas principales son: foundation-models, grounding, large-language-models, llama.

Frequently asked questions

¿Qué es Groma?

[ECCV2024] Modelo de Lenguaje Grande Multimodal Fundamentado con Tokenización Visual Localizada

¿Groma es de código abierto?

Groma es un proyecto de código abierto. Se distribuye bajo la licencia Apache-2.0.

¿Groma es gratis?

Sí. Groma es gratuito y de código abierto: puedes usarlo, modificarlo y alojarlo tú mismo.

¿Bajo qué licencia está Groma?

Groma está disponible bajo la licencia Apache-2.0.

¿En qué lenguaje está escrito Groma?

Groma está escrito principalmente en Python.

🏅 ¿Mantenedor de este proyecto?
OpenSourceAI badge — Groma

Agrega este distintivo en vivo a tu README — tus estrellas de GitHub y rango en el directorio, actualizados diariamente.

[![OpenSourceAI](https://opensourceai.tech/badge.php?tool=foundationvision-groma)](https://opensourceai.tech/project/foundationvision-groma.html)
Más opciones de distintivos →
🧬 Comparte ADN con🧬 Ver el mapa de ADN →
Thinking-with-Visual-Primitives
Instantánea archivada de Thinking-with-Visual-Primitives
273 · deepseek
compartegroundingvision-language-model
LLaVA
[NeurIPS'23 Oral] Ajuste de Instrucciones Visuales (LLaVA) construido hacia capacidades de nive…
25k · chatbot
compartellama2vision-language-model
NExT-GPT
Código y modelos para el artículo ICML 2024, NExT-GPT: Modelo de Lenguaje Grande Multimodal de…
3.6k · chatgpt
compartemllmfoundation-models
OPERA
[CVPR 2024 Destacado] OPERA: Aliviando la alucinación en Modelos de Lenguaje Grande Multimodal…
412 · chatbot
compartevision-language-modelllama
Awesome-Multimodal-LLM-Autonomous-Driving
[WACV 2024 Survey Paper] Modelos de Lenguaje Multimodal para Conducción Autónoma
313 · autonomous-car
compartevision-language-modelfoundation-models
R1-VL
R1-VL: Aprendiendo a Razonar con Modelos de Lenguaje Grande Multimodal a través de Optimización…
352 · mllm
compartemllmvision-language-model
Olympus
[CVPR 2025 Destacado] Código oficial para "Olympus: Un Enrutador de Tareas Universal para Tarea…
428 · chatbot
compartevision-language-modelfoundation-models
tokenize-anything
[ECCV 2024] Tokenizar Cualquier Cosa a través de Prompts
601 · foundation-models
compartefoundation-modelsmultimodal
VoxPoser
VoxPoser: Mapas de Valor 3D Componibles para Manipulación Robótica con Modelos de Lenguaje
826 · embodied-ai
compartevision-language-modelfoundation-models
mllm
LLM multimodal rápido en dispositivos móviles.
1.6k · ai
compartellamamultimodal

Medido a partir de los topics de GitHub comunes a ambos proyectos, ponderados por su rareza.