Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

news.futunnmarktechpost+1digg+1Investigadores de la Universidad de Pekín y DeepSeek lanzaron DSpark el 27 de junio, un marco de decodificación especulativa de código abierto que acelera la inferencia de modelos de lenguaje grandes entre un 60 y un 85 por ciento por usuario en sistemas de producción en vivo, marcando el primer lanzamiento técnico importante del laboratorio de IA chino desde su ronda de financiación de 7 mil millones de dólares.marktechpost+2
La decodificación especulativa divide la generación de texto en dos roles: un modelo de borrador pequeño y rápido propone un lote de tokens, y el modelo objetivo completo verifica ese lote en una sola pasada hacia adelante, manteniendo todos los tokens con los que está de acuerdo. DSpark mejora los enfoques anteriores con dos adiciones. Primero, en lugar de entrenar un modelo de borrador separado desde cero, injerta un encabezado especulativo ligero directamente en el punto de control del modelo existente, lo que significa que la calidad de salida del modelo subyacente permanece sin cambios. Segundo, un sistema de puntuación de confianza le da a cada token redactado una probabilidad de sobrevivir a la verificación, mientras que un programador consciente del hardware ajusta cuántos tokens se verifican según la carga actual de la GPU. Cuando el tráfico es ligero, el sistema verifica series de conjeturas más largas; cuando el tráfico es intenso, descarta los tokens de baja confianza antes de que consuman cómputo.digg+3
En el entorno de producción en línea de DeepSeek que maneja el tráfico real de los usuarios, DSpark ofreció una generación por usuario entre un 60 y un 85 por ciento más rápida en V4-Flash y entre un 57 y un 78 por ciento en V4-Pro en comparación con la línea base MTP-1 anterior de DeepSeek. Bajo ciertas condiciones de latencia, las ganancias de rendimiento alcanzaron hasta un 661 por ciento en Flash y un 406 por ciento en Pro. Las pruebas comparativas fuera de línea mostraron que la longitud de los tokens aceptados aumentó entre un 26 y un 31 por ciento sobre Eagle3 y entre un 16 y un 18 por ciento sobre DFlash.youtube+2
El marco es agnóstico al modelo. DeepSeek demostró la compatibilidad con los puntos de control Qwen3 de Alibaba y Gemma de Alphabet Inc. de Google. Junto con DSpark, el equipo lanzó como código abierto DeepSpec, una base de código de pila completa para entrenar y evaluar redactores de decodificación especulativa, todo bajo una licencia MIT en GitHub.marktechpost+3
El lanzamiento llega mientras DeepSeek se prepara para lanzar oficialmente su modelo V4 a mediados de julio con un nuevo mecanismo de precios de API de pico y fuera de pico. DSpark ya está completamente implementado en los servicios en línea de DeepSeek, lo que reduce el cómputo de GPU desperdiciado por verificaciones no válidas mientras mantiene una calidad de salida idéntica a la del modelo base. El fundador de DeepSeek, Liang Wenfeng, fue coautor del artículo adjunto, titulado "DSpark: Decodificación especulativa programada por confianza con generación semiautorregresiva".pandaily+1