Deepseek ha lanzado un nuevo modelo experimental conocido como V4-Flash-Vision-Exp, que incorpora capacidades de comprensión visual además de su rendimiento textual. En las pruebas internas de la compañía, este modelo se aproxima a los resultados de Opus 4.8 en tareas específicas para agentes, destacando su versatilidad para aplicaciones que requieren un manejo multimodal.
El modelo es capaz de describir imágenes, extraer texto de capturas de pantalla y analizar diagramas, funcionando con formatos como JPEG, PNG, GIF y WebP. También se han introducido mejoras en su marco de trabajo Harness, en su versión 0.1.1, que ya es compatible con este nuevo modelo. Los desarrolladores tienen diversas opciones para enviar imágenes, incluyendo la codificación Base64 y un nuevo API de archivos que permite subir documentos de hasta 64 MiB.
Además, el modelo permite la inclusión de hasta 600 imágenes en una sola solicitud, con un tamaño máximo de 8,192 píxeles por lado, que se reduce a 4,096 píxeles si se incluyen 15 o más imágenes. Cada imagen procesada tiene un coste máximo de 384 tokens, independientemente de su resolución original.