DeepSeek lanzó su modelo V4.1-Flash el jueves, presentando una arquitectura de mezcla de expertos de 552B parámetros, con 8B parámetros activos para la entrada y 16B para la salida.
El modelo utiliza una nueva arquitectura de codificador-decodificador causal y admite entradas multimodales nativas, incluida la comprensión visual, según un comunicado. DeepSeek afirmó que V4.1-Flash es el modelo más pequeño de su nueva familia de arquitecturas.
Un cambio clave es la reducción de la huella de la caché KV del modelo, señaló la empresa, que añadió que V4.1-Flash requiere una cuarta parte de la HBM y una octava parte del almacenamiento SSD utilizados por la generación anterior.
Según la empresa, la caché más pequeña reduce los requisitos de almacenamiento para cargas de trabajo agénticas, en las que los costes de las coincidencias de caché pueden representar una parte significativa de los costes totales de uso.
V4.1-Flash ya está disponible a través de la API de DeepSeek, mientras que los modelos anteriores V4-Flash y V4-Flash-Vision-Exp han sido retirados. Sus nombres de API dirigirán temporalmente las solicitudes a V4.1-Flash para garantizar la compatibilidad.
Cabe destacar que V4.1-Flash superó a V4-Pro en rendimiento, coste, velocidad y tiempo de ejecución total en pruebas realizadas por varias entidades, por lo que la empresa está retirando gradualmente este último.
A partir de la próxima semana, el 14 de septiembre a las 04:00 UTC, DeepSeek dirigirá todas las solicitudes realizadas a V4 Pro a V4.1-Flash y las facturará según las tarifas del modelo más reciente. Este acuerdo se mantendrá hasta que DeepSeek lance V4.1-Pro, según el comunicado.
La empresa ha ajustado los precios de la API de V4.1-Flash, con tarifas en horas valle fijadas en la mitad del precio en horas punta. Los nuevos precios entraron en vigor a las 04:00 UTC del 10 de septiembre. WorkBuddy y CodeBuddy, de Tencent, junto con OpenCode, ya son compatibles con el modelo.
