Saltar al contenido
OndaCorta

DeepSeek suma visión a su IA y apunta a Claude Opus 4.8

La empresa china lanzó una versión experimental de su modelo V4 Flash que ahora interpreta imágenes y capturas de pantalla, con el mismo precio que la versión de solo texto.

Por Nahuel Soria · · 2 min de lectura

DeepSeek presentó DeepSeek-V4-Flash-Vision-Exp, una rama experimental de su modelo V4 Flash que ahora puede leer imágenes y capturas de pantalla, no solo texto. La empresa china anunció la novedad en su cuenta de X y sostiene que, en las tareas donde el modelo actúa como agente sobre lo que ve, su desempeño queda a la altura de Claude Opus 4.8, el modelo insignia de Anthropic.

Hasta ahora, la capacidad de interpretar imágenes en el catálogo de DeepSeek quedaba limitada a la familia DeepSeek-VL, separada de los modelos de propósito general. Con esta variante experimental, la visión se suma directamente al V4 Flash, el modelo que debutó meses atrás y que ya tenía buena reputación por su relación entre costo y capacidad de razonamiento.

Según la empresa, sumar la lectura de imágenes no le restó filo al razonamiento de texto: la versión con visión responde con la misma solidez que la original a la hora de resolver problemas o manejar contexto. También conservó la posibilidad de operar como agente, es decir, de encadenar pasos y ejecutar tareas por su cuenta a partir de lo que interpreta en una foto o una captura, sin que un humano tenga que intervenir en cada paso.

El boletín de Onda Corta

Lo más importante de la semana en tecnología, en tu correo los domingos.

Precio: cero recargo por ver

DeepSeek decidió no tocar la tarifa de V4 Flash pese a agregarle visión: pagás lo mismo que si solo mandaras texto. Ese acceso llega por API y, según la compañía, es gratuito y compatible con los frameworks de agentes más usados del mercado.

Las consultas pueden combinar texto e imagen de tres maneras: codificando la imagen en base64, apuntando a una URL externa, o subiéndola a la nueva API de archivos que la empresa presentó junto con este lanzamiento, que permite reutilizar la misma imagen en pedidos futuros con solo un identificador, sin volver a cargarla.

Para la facturación, cada imagen se convierte en un máximo de 384 tokens, la unidad con la que se mide y cobra el uso de un modelo de lenguaje. El sistema acepta archivos en JPEG, PNG, GIF y WebP, de hasta 8192 píxeles por lado, con un tope de 32 MiB si se envían por base64 o URL, y de 64 MiB por la API de archivos. Una misma consulta admite hasta 600 imágenes, y antes de procesarlas el modelo las reescala: las que miden 384 x 384 píxeles o menos se agrandan sin deformar la proporción, y las más grandes se reducen hasta un tamaño equivalente a una de 800 x 800.

Para probarlo hay que registrarse en la plataforma de DeepSeek, generar una clave de API y llamar al modelo con el identificador deepseek-v4-flash-vision-exp. La respuesta combina, en una sola llamada, el razonamiento del modelo y la lectura de la imagen.

El lanzamiento llega después de los de Kimi K3 y Qwen 3.8, otros dos modelos chinos que también le suman presión a Anthropic combinando precios bajos con capacidades cada vez más cercanas a las de los modelos comerciales líderes.

El boletín de Onda Corta

Lo más importante de la semana en tecnología, sin ruido. Todos los domingos a la mañana en tu correo.

Fuentes

  1. DeepSeek presenta una IA que interpreta imágenes casi tan bien como Claude Opus 4.8 (hipertextual.com)

Este artículo fue elaborado por el sistema editorial automatizado de Onda Corta a partir de las fuentes citadas, con supervisión humana del proceso. ¿Encontraste un error? Reportalo.

Seguí leyendo

El boletín de Onda Corta

Lo más importante de la semana en tecnología, sin ruido. Todos los domingos a la mañana en tu correo.