DeepSeek-VL y DeepSeek-VL2 son familias de modelos que combinan imágenes y lenguaje. Sus publicaciones permiten estudiar tareas visuales y preparar despliegues propios. No son nombres genéricos para todas las funciones de imagen de DeepSeek.
Qué publicó la familia VL original
El repositorio oficial de DeepSeek-VL presenta modelos de 1,3 y 7 mil millones de parámetros, con variantes Base y Chat. La publicación describe comprensión multimodal y facilita ejemplos para procesar imágenes junto con preguntas.
La variante elegida determina cómo debes preparar la entrada. Revisa el procesador de imágenes y la plantilla del repositorio antes de adaptar un ejemplo de un modelo solo textual. Una imagen que no llega correctamente al modelo puede dar lugar a una respuesta plausible que no utiliza su contenido.
Qué cambia en VL2
DeepSeek-VL2 es una familia posterior con arquitectura de mezcla de expertos. El proyecto publica las variantes Tiny, Small y VL2, y aborda tareas como preguntas sobre imágenes, lectura de documentos y comprensión de tablas o gráficos.
Los nombres Tiny y Small son relativos a esta familia. No sustituyen comprobar los requisitos del motor de inferencia, los pesos completos y la memoria necesaria para la tarea.
Qué puedes evaluar con imágenes en español
- Un gráfico: identificar ejes, unidades y series antes de pedir una conclusión.
- Un diagrama: describir elementos y conexiones, separando lo visible de lo inferido.
- Una página: responder una pregunta cuya solución pueda localizarse en el documento.
- Una tabla: relacionar una cifra con su encabezado y comprobarla visualmente.
Empieza con archivos que puedas compartir y preguntas cuya respuesta conozcas. Después introduce imágenes menos nítidas, textos pequeños o diseños complejos. Registra cuándo falla la lectura y cuándo falla la interpretación: son problemas distintos.
Cómo distinguir VL de la visión de la API
La tarea puede parecerse; el despliegue cambia
Pesos en tu entorno
Servicio alojado
- Preparas una imagen y una pregunta.
- Consultas un endpoint y un modelo vigente que admita ese formato.
- Revisas la respuesta y las condiciones del proveedor.
Compartir una tarea visual no significa utilizar los mismos pesos o la misma interfaz. Estos recorridos explican el acceso; no son resultados de una prueba.
Una integración alojada debe utilizar las funciones y los identificadores que documente su proveedor. Los antiguos repositorios VL no demuestran que una API actual ejecute esos mismos pesos. Consulta la ficha de las versiones actuales para revisar su compatibilidad visual.
Si tu objetivo principal es extraer texto y conservar la estructura de documentos, revisa también DeepSeek OCR y OCR 2. Una descripción general de la página y una transcripción fiel requieren criterios diferentes.
Antes de integrar
Guarda una muestra de imágenes con respuestas de referencia y fija la revisión del modelo. Comprueba permisos y licencia en el repositorio correspondiente. Esta guía no atribuye una precisión medida en español a ninguna variante; ofrece criterios para que puedas evaluarla sobre tus documentos.