Inicio Proyectos Groma
Groma
Python

Groma

[ECCV2024] Modelo de Lenguaje Grande Multimodal Fundamentado con Tokenización Visual Localizada

por FoundationVision · GitHub
Estrellas
Ramas
Licencia
Creado
Último commit
Lenguaje
Probable
Autoalojable
foundation-modelsgroundinglarge-language-modelsApache-2.0PythonAutoalojable
Ver en GitHub
En palabras simples

Interactúa con un modelo de lenguaje grande que entiende el contexto visual y puede generar respuestas detalladas basadas en imágenes.

¿Mantienes este proyecto?

Reivindica su pagina: indexada sea cual sea su posicion, traducida a seis idiomas y enriquecida con tus propias palabras.

Reivindicar esta pagina →
Groma — GitHub preview card
📈 Historial de estrellas
586585
2026-07-202026-08-31
📈 Sigue Groma

Recibe una alerta por correo en su próximo lanzamiento o cuando despegue — no te pierdas nada.

Gratis · sin tarjeta · cancela cuando quieras
Recibir alertas por email →
📄 Acerca de

[ECCV2024] Modelo de Lenguaje Grande Multimodal Fundamentado con Tokenización Visual Localizada

Groma tiene 586 estrellas en GitHub. Se ha bifurcado 44 veces. Groma está escrito principalmente en Python. Se desarrolla activamente desde 2024. Groma está disponible bajo la licencia Apache-2.0. Sus temas principales son: foundation-models, grounding, large-language-models, llama.

Frequently asked questions

¿Qué es Groma?

[ECCV2024] Modelo de Lenguaje Grande Multimodal Fundamentado con Tokenización Visual Localizada

¿Groma es de código abierto?

Groma es un proyecto de código abierto. Se distribuye bajo la licencia Apache-2.0.

¿Groma es gratis?

Sí. Groma es gratuito y de código abierto: puedes usarlo, modificarlo y alojarlo tú mismo.

¿Bajo qué licencia está Groma?

Groma está disponible bajo la licencia Apache-2.0.

¿En qué lenguaje está escrito Groma?

Groma está escrito principalmente en Python.

🏅 ¿Mantenedor de este proyecto?
olud.ai badge — Groma

Agrega este distintivo en vivo a tu README — tus estrellas de GitHub y rango en el directorio, actualizados diariamente.

[![olud.ai](https://olud.ai/badge.php?tool=foundationvision-groma)](https://olud.ai/project/foundationvision-groma.html)
Más opciones de distintivos →
🧬 Comparte ADN con🧬 Ver el mapa de ADN →
Thinking-with-Visual-Primitives
Archived snapshot of Thinking-with-Visual-Primitives
276 · deepseek
compartegroundingvision-language-model
NExT-GPT
Código y modelos para el artículo ICML 2024, NExT-GPT: Modelo de Lenguaje Grande Multimodal de…
3.6k · chatgpt
compartemllmfoundation-models
Awesome-Reasoning-Foundation-Models
✨✨Últimos artículos y benchmarks en razonamiento con modelos base
656 · foundation-models
compartefoundation-modelsmultimodal
Awesome-Multimodal-LLM-Autonomous-Driving
[WACV 2024 Survey Paper] Modelos de Lenguaje Multimodal para Conducción Autónoma
311 · autonomous-car
compartevision-language-modelfoundation-models
mPLUG-DocOwl
mPLUG-DocOwl: Modelo de Lenguaje Grande Multimodal Modularizado para Comprensión de Documentos
2.4k · chart-understanding
compartemllmmultimodal
lag-llama
Lag-Llama: Hacia modelos de fundación para pronósticos de series temporales probabilísticas.
1.6k · forecasting
compartefoundation-modelsllama
VoxPoser
VoxPoser: Mapas de Valor 3D Componibles para Manipulación Robótica con Modelos de Lenguaje
833 · embodied-ai
compartevision-language-modelfoundation-models
ONE-PEACE
Un modelo de representación general a través de modalidades de visión, audio y lenguaje. Artícu…
1.1k · audio-language
compartefoundation-modelsmultimodal
tokenize-anything
[ECCV 2024] Tokenizar Cualquier Cosa a través de Prompts
601 · foundation-models
compartefoundation-modelsmultimodal
mllm
LLM multimodal rápido en dispositivos móviles.
1.6k · ai
compartellamamultimodal

Medido a partir de los topics de GitHub comunes a ambos proyectos, ponderados por su rareza.