Inicio› Proyectos› agent-vision-toolkit
agent-vision-toolkit
Python

agent-vision-toolkit

Un conjunto de herramientas visuales y una habilidad diseñados para que los modelos de solo texto "vean imágenes": preguntas y respuestas sobre imágenes, OCR de capturas largas, restauración de interfaz de usuario frontend y automatización de GUI, con integración opcional y fluida con múltiples agentes principales, reconociendo imágenes pegadas directamente.

por Anionex · GitHub
Estrellas
Ramas
Licencia
Creado
Último commit
Categoría
Lenguaje
agentagent-skillsclaude-codeMITPython
Ver en GitHub
En palabras simples

Equipe a los agentes de codificación solo de texto con capacidades de procesamiento de imágenes, como responder preguntas sobre imágenes y comprender capturas de pantalla.

✓ Reivindicada por su responsable
agent-vision-toolkit — GitHub preview card
📈 Historial de estrellas
1k0k
2026-08-102026-08-31
📈 Sigue agent-vision-toolkit

Recibe una alerta por correo en su próximo lanzamiento o cuando despegue — no te pierdas nada.

Gratis · sin tarjeta · cancela cuando quieras
Recibir alertas por email →
📄 Acerca de

Un conjunto de herramientas visuales y una habilidad diseñados para que los modelos de solo texto "vean imágenes": preguntas y respuestas sobre imágenes, OCR de capturas largas, restauración de interfaz de usuario frontend y automatización de GUI, con integración opcional y fluida con múltiples agentes principales, reconociendo imágenes pegadas directamente.

agent-vision-toolkit tiene 1.1k estrellas en GitHub. Se ha bifurcado 38 veces. agent-vision-toolkit está escrito principalmente en Python. Se desarrolla activamente desde 2026. agent-vision-toolkit está disponible bajo la licencia MIT. Sus temas principales son: agent, agent-skills, claude-code, codex.

❓ Frequently asked questions

¿Qué es agent-vision-toolkit?

Un conjunto de herramientas visuales y una habilidad diseñados para que los modelos de solo texto "vean imágenes": preguntas y respuestas sobre imágenes, OCR de capturas largas, restauración de interfaz de usuario frontend y automatización de GUI, con integración opcional y fluida con múltiples agentes principales, reconociendo imágenes pegadas directamente.

¿agent-vision-toolkit es de código abierto?

agent-vision-toolkit es un proyecto de código abierto. Se distribuye bajo la licencia MIT.

¿agent-vision-toolkit es gratis?

Sí. agent-vision-toolkit es gratuito y de código abierto: puedes usarlo, modificarlo y alojarlo tú mismo.

¿Bajo qué licencia está agent-vision-toolkit?

agent-vision-toolkit está disponible bajo la licencia MIT.

¿En qué lenguaje está escrito agent-vision-toolkit?

agent-vision-toolkit está escrito principalmente en Python.

🏅 ¿Mantenedor de este proyecto?
olud.ai badge — agent-vision-toolkit

Agrega este distintivo en vivo a tu README — tus estrellas de GitHub y rango en el directorio, actualizados diariamente.

[![olud.ai](https://olud.ai/badge.php?tool=anionex-agent-vision-toolkit)](https://olud.ai/project/anionex-agent-vision-toolkit.html)
Más opciones de distintivos →
🧬 Comparte ADN con🧬 Ver el mapa de ADN →
modlens
El primer plugin de visión para DeepSeek Harness, y el puente de visión para cada agente de cod…
★ 3.8k · agent-skills
compartetext-only-llmvision
codex-vision-proxy
让纯文本模型在 Codex 中无障碍看图(view_image)的更优方案,附为纯文本 LLM 设计的视觉工具包&skill | A superior approach for enabl…
★ 273 · agent
comparteglmharness-engineering
dsh-vision-complete
给 DeepSeek 补上「眼睛和耳朵」的多模态视觉插件:看图 / OCR / 物体检测 / 视频理解 / 语音转写 / 截图直读,一键安装(DSH 插件)。
★ 42 · dashscope
compartevisiondsh-plugin
claude-code-vision-skill
为 Claude Code 赋能多模态视觉能力,适配 纯文本 LLM 底座,用于截图 / UI / 图表分析;搭配 browser-harness 可做前端布局自动化检查。
★ 171 · agent-skills
compartevisiondeepseek
GLM-skills
Habilidades oficiales para la familia de modelos GLM.
★ 468 · glm
compartevisionglm
dsh-vision-router
Ojos para agentes de DeepSeek Harness solo de texto: cadena de visión gratuita incorporada (sin…
★ 1k · deepseek-harness
compartevisiondsh-plugin
dsh-vision
Near-native image understanding for DeepSeek Harness
★ 88 · deepseek-harness
compartevisiondsh-plugin
Thinking-with-Visual-Primitives
Archived snapshot of Thinking-with-Visual-Primitives
★ 276 · deepseek
compartevision-language-modeldeepseek
JavaGuide
Guía de entrevistas de Java & entrevistas generales de backend, cubriendo fundamentos de comput…
★ 157k · agent
dify
Crea flujos de trabajo Agentic, pipelines RAG, con un rico soporte de modelos y herramientas de…
★ 154k · agent

Medido a partir de los topics de GitHub comunes a ambos proyectos, ponderados por su rareza.