Startseite Projekte OmniVinci
OmniVinci
Python

OmniVinci

OmniVinci ist ein omni-modales LLM für das gemeinsame Verständnis von Vision, Audio und Sprache.

von NVlabs · GitHub
Sterne
Forks
Erstellt
Letzter Commit
Sprache
audio-language-modeldeep-learninglarge-language-modelsApache-2.0Python
Auf GitHub ansehen
In einfachen Worten

Verstehen und analysieren Sie Informationen aus Bildern, Audio und Text gemeinsam mit einem multimodalen KI-Modell.

Betreuen Sie dieses Projekt?

Beanspruchen Sie die Seite: indexiert unabhangig vom Rang, in sechs Sprachen ubersetzt und mit Ihren eigenen Worten erganzt.

Diese Seite beanspruchen →
OmniVinci — GitHub preview card
📈 Sternhistorie
677674
2026-07-202026-08-31
📈 OmniVinci verfolgen

Erhalten Sie eine E-Mail-Benachrichtigung beim nächsten Release oder wenn es durchstartet.

Kostenlos · ohne Karte · jederzeit abbestellbar
E-Mail-Alerts erhalten →
📄 Über

OmniVinci ist ein omni-modales LLM für das gemeinsame Verständnis von Vision, Audio und Sprache.

OmniVinci hat 677 Sterne auf GitHub. Es wurde 56-mal geforkt. OmniVinci ist hauptsächlich in Python geschrieben. Es wird seit 2025 aktiv entwickelt. OmniVinci ist unter der Apache-2.0-Lizenz verfügbar. Die Hauptthemen sind: audio-language-model, deep-learning, large-language-models, multimodal-large-language-models.

Frequently asked questions

Was ist OmniVinci?

OmniVinci ist ein omni-modales LLM für das gemeinsame Verständnis von Vision, Audio und Sprache.

Ist OmniVinci Open Source?

OmniVinci ist ein Open-Source-Projekt. Es wird unter der Apache-2.0-Lizenz veröffentlicht.

Ist OmniVinci kostenlos?

Ja. OmniVinci ist kostenlos und Open Source — Sie können es nutzen, anpassen und selbst hosten.

Unter welcher Lizenz steht OmniVinci?

OmniVinci ist unter der Apache-2.0-Lizenz verfügbar.

In welcher Sprache ist OmniVinci geschrieben?

OmniVinci ist hauptsächlich in Python geschrieben.

🏅 Wartender dieses Projekts?
olud.ai badge — OmniVinci

Fügen Sie dieses Live-Abzeichen zu Ihrem README hinzu — Ihre GitHub-Sterne und Verzeichnisrang, täglich aktualisiert.

[![olud.ai](https://olud.ai/badge.php?tool=nvlabs-omnivinci)](https://olud.ai/project/nvlabs-omnivinci.html)
Weitere Abzeichenoptionen →
🧬 Teilt DNA mit🧬 DNA-Karte ansehen →
Qwen-VL
Das offizielle Repository von Qwen-VL (通义千问-VL) Chat & vortrainiertem großem Sprachmodell, das…
6.7k · large-language-models
teiltvision-language-model
t2v_metrics
Bewertung von Text-zu-Bild-/Video-/3D-Modellen mit VQAScore
600 · generative-ai
teiltvision-language-model
SoundMind
Wir stellen den Audio Logical Reasoning (ALR) Datensatz vor, der aus 6.446 text-audio annotiert…
1.1k · audio-language-model
teiltaudio-language-model
Fun-ASR
Open-Source-LLM-basierte ASR-Modellfamilie für Chinesisch, Dialekte, Akzente und mehrsprachige…
1.4k · 31-languages
teiltaudio-language-model
RoboFlamingo
Code für RoboFlamingo
437 · artificial-intelligence
teiltvision-language-model
Awesome-Medical-Large-Language-Models
Kuratiertes Papier zu großen Sprachmodellen im Gesundheitswesen und medizinischen Bereich
390 · large-language-models
teiltmultimodal-large-language-models
Awesome-Multimodal-LLM-Autonomous-Driving
[WACV 2024 Umfragepapier] Multimodale große Sprachmodelle für autonomes Fahren
311 · autonomous-car
teiltmultimodal-large-language-modelsvision-language-model
Spatial-MLLM
[NeurIPS 2025 Spotlight] Offizielle Implementierung von Spatial-MLLM: Verbesserung der MLLM-Fäh…
477 · aigc
teiltmultimodal-large-language-models
MGM
Offizielles Repository für "Mini-Gemini: Mining the Potential of Multi-modality Vision Language…
3.3k · generation
teiltvision-language-model
Ovis-U1
Ein einheitliches Modell, das multimodales Verständnis, Text-zu-Bild-Generierung und Bildbearbe…
450 · image-editing
teiltmultimodal-large-language-models

Ermittelt aus gemeinsamen GitHub-Topics beider Projekte, gewichtet nach ihrer Seltenheit.