DeepSeek suma visión a su IA y apunta a Claude Opus 4.8
La empresa china lanzó una versión experimental de su modelo V4 Flash que ahora interpreta imágenes y capturas de pantalla, con el mismo precio que la versión de solo texto.

DeepSeek presentó DeepSeek-V4-Flash-Vision-Exp, una rama experimental de su modelo V4 Flash que ahora puede leer imágenes y capturas de pantalla, no solo texto. La empresa china anunció la novedad en su cuenta de X y sostiene que, en las tareas donde el modelo actúa como agente sobre lo que ve, su desempeño queda a la altura de Claude Opus 4.8, el modelo insignia de Anthropic.
Hasta ahora, la capacidad de interpretar imágenes en el catálogo de DeepSeek quedaba limitada a la familia DeepSeek-VL, separada de los modelos de propósito general. Con esta variante experimental, la visión se suma directamente al V4 Flash, el modelo que debutó meses atrás y que ya tenía buena reputación por su relación entre costo y capacidad de razonamiento.
Según la empresa, sumar la lectura de imágenes no le restó filo al razonamiento de texto: la versión con visión responde con la misma solidez que la original a la hora de resolver problemas o manejar contexto. También conservó la posibilidad de operar como agente, es decir, de encadenar pasos y ejecutar tareas por su cuenta a partir de lo que interpreta en una foto o una captura, sin que un humano tenga que intervenir en cada paso.
El boletín de Onda Corta
Precio: cero recargo por ver
DeepSeek decidió no tocar la tarifa de V4 Flash pese a agregarle visión: pagás lo mismo que si solo mandaras texto. Ese acceso llega por API y, según la compañía, es gratuito y compatible con los frameworks de agentes más usados del mercado.
Las consultas pueden combinar texto e imagen de tres maneras: codificando la imagen en base64, apuntando a una URL externa, o subiéndola a la nueva API de archivos que la empresa presentó junto con este lanzamiento, que permite reutilizar la misma imagen en pedidos futuros con solo un identificador, sin volver a cargarla.
Para la facturación, cada imagen se convierte en un máximo de 384 tokens, la unidad con la que se mide y cobra el uso de un modelo de lenguaje. El sistema acepta archivos en JPEG, PNG, GIF y WebP, de hasta 8192 píxeles por lado, con un tope de 32 MiB si se envían por base64 o URL, y de 64 MiB por la API de archivos. Una misma consulta admite hasta 600 imágenes, y antes de procesarlas el modelo las reescala: las que miden 384 x 384 píxeles o menos se agrandan sin deformar la proporción, y las más grandes se reducen hasta un tamaño equivalente a una de 800 x 800.
Para probarlo hay que registrarse en la plataforma de DeepSeek, generar una clave de API y llamar al modelo con el identificador deepseek-v4-flash-vision-exp. La respuesta combina, en una sola llamada, el razonamiento del modelo y la lectura de la imagen.
El lanzamiento llega después de los de Kimi K3 y Qwen 3.8, otros dos modelos chinos que también le suman presión a Anthropic combinando precios bajos con capacidades cada vez más cercanas a las de los modelos comerciales líderes.


El boletín de Onda Corta