1
00:00:09,679 --> 00:00:15,660
Buenas, esto es BIMPRAXIS, el podcast donde el

2
00:00:15,660 --> 00:00:17,739
BIM se encuentra con la inteligencia artificial.

3
00:00:20,320 --> 00:00:23,480
Exploramos la ciencia, la tecnología y el futuro

4
00:00:23,480 --> 00:00:26,420
desde el enfoque de la arquitectura, ingeniería y

5
00:00:26,420 --> 00:00:27,120
construcción.

6
00:00:28,780 --> 00:00:29,440
¡Empezamos!

7
00:00:36,799 --> 00:00:40,439
Muy buenas, bienvenidas, bienvenidos a un nuevo episodio

8
00:00:40,439 --> 00:00:41,219
de BIMPRAXIS.

9
00:00:41,219 --> 00:00:44,140
Hoy os traemos el modelo M3 de Minimax,

10
00:00:44,299 --> 00:00:47,380
como una sola imagen acaba de reescribir las

11
00:00:47,380 --> 00:00:50,020
reglas de la inteligencia artificial de código abierto

12
00:00:50,020 --> 00:00:52,520
y destronando a los gigantes de la industria.

13
00:00:52,700 --> 00:00:55,100
Y bueno, plantear que los ha destronado así,

14
00:00:55,240 --> 00:00:58,500
de entrada, parecía un titular supersensacionalista, la verdad.

15
00:00:58,719 --> 00:01:00,060
Ya, suena a humo, total.

16
00:01:00,320 --> 00:01:01,299
Sí, sí, suena a humo.

17
00:01:01,359 --> 00:01:03,140
Pero es que los datos que traemos hoy

18
00:01:03,140 --> 00:01:06,420
para desgranar apuntan exactamente en esa dirección, o

19
00:01:06,420 --> 00:01:07,340
sea, sin exagerar.

20
00:01:07,640 --> 00:01:09,060
Piensa en la magnitud del tema.

21
00:01:09,060 --> 00:01:11,819
Hablamos de un modelo que cualquiera puede descargar,

22
00:01:11,879 --> 00:01:15,420
que corre en servidores convencionales y que acaba

23
00:01:15,420 --> 00:01:19,540
de, digamos, humillar a modelos privativos multimillonarios en

24
00:01:19,540 --> 00:01:21,760
tareas de razonamiento que son hipercomplejas.

25
00:01:21,939 --> 00:01:23,099
Es que es una pasada.

26
00:01:23,260 --> 00:01:25,219
Y lo más fascinante de todo, de todo

27
00:01:25,219 --> 00:01:27,599
este salto tecnológico, es que la clave se

28
00:01:27,599 --> 00:01:30,359
escondía a plena vista, en un simple esquema.

29
00:01:30,480 --> 00:01:32,000
Esa es la paradoja que a mí me

30
00:01:32,000 --> 00:01:35,359
tiene completamente fascinada, o sea, un solo diagrama

31
00:01:35,359 --> 00:01:36,840
desvelando el gran secreto.

32
00:01:36,939 --> 00:01:39,040
Y a ver, para intentar comprender este territorio…

33
00:01:39,060 --> 00:01:40,700
Tremoto en la industria, hoy vamos a cruzar

34
00:01:40,700 --> 00:01:43,359
la información de dos fuentes que son excepcionales.

35
00:01:43,579 --> 00:01:44,099
Exacto.

36
00:01:44,099 --> 00:01:46,980
Por una parte, tenemos un artículo técnico súper

37
00:01:46,980 --> 00:01:50,019
detallado que publicó la comunidad de Hugging Face

38
00:01:50,019 --> 00:01:52,340
este 29 de mayo de 2026.

39
00:01:52,700 --> 00:01:56,000
Ahí se disecciona toda la arquitectura matemática, las

40
00:01:56,000 --> 00:01:58,340
tripas del modelo… Lo cual es denso, pero

41
00:01:58,340 --> 00:01:58,780
fundamental.

42
00:01:59,340 --> 00:02:00,060
Muy denso.

43
00:02:00,200 --> 00:02:02,280
Pero claro, para no quedarnos solo en la

44
00:02:02,280 --> 00:02:05,500
teoría, la segunda fuente es un análisis exhaustivo,

45
00:02:05,519 --> 00:02:07,640
en vídeo, de un creador que ha cogido

46
00:02:07,640 --> 00:02:09,539
el modelo y, bueno, lo ha sometido a

47
00:02:09,539 --> 00:02:11,319
pruebas extremas en el mundo real.

48
00:02:11,500 --> 00:02:13,840
Claro, es que el contexto temporal aquí es

49
00:02:13,840 --> 00:02:15,759
súper importante para valorar este avance.

50
00:02:16,199 --> 00:02:19,060
Tenemos que retroceder un poco, irnos a octubre

51
00:02:19,060 --> 00:02:19,659
de 2025.

52
00:02:20,439 --> 00:02:23,479
En aquel momento, la empresa detrás de esto,

53
00:02:23,580 --> 00:02:26,000
Minimax, publicó una entrada en su blog oficial

54
00:02:26,000 --> 00:02:28,639
reconociendo un fracaso, tal cual.

55
00:02:29,060 --> 00:02:30,340
Sí, sí, que eso no se ve mucho

56
00:02:30,340 --> 00:02:31,159
en esta industria.

57
00:02:31,379 --> 00:02:31,740
Para nada.

58
00:02:32,620 --> 00:02:35,680
Explicaron muy abiertamente porque su modelo anterior, el

59
00:02:35,680 --> 00:02:39,159
M2, había terminado usando una arquitectura tradicional, tradicional

60
00:02:39,159 --> 00:02:40,180
de atención completa.

61
00:02:40,539 --> 00:02:45,060
O sea, básicamente, admitieron que las técnicas de

62
00:02:45,060 --> 00:02:47,599
atención eficiente no les daban la calidad necesaria

63
00:02:47,599 --> 00:02:49,099
para un entorno real de producción.

64
00:02:49,580 --> 00:02:52,319
Y aquello fue, recuerdo, un jarro de agua

65
00:02:52,319 --> 00:02:55,060
fría total para la comunidad de código abierto.

66
00:02:55,340 --> 00:02:57,300
Todo el mundo esperaba un modelo mucho más

67
00:02:57,300 --> 00:02:57,780
ligero.

68
00:02:58,020 --> 00:02:58,580
Totalmente.

69
00:02:58,879 --> 00:03:02,900
Pero claro, seis meses después lanzan este M3.

70
00:03:03,379 --> 00:03:05,639
Y de repente superan a monstruos como el

71
00:03:05,639 --> 00:03:08,780
GPT 5 .5 al Opus 4 .7.

72
00:03:08,800 --> 00:03:12,039
Y lo hacen manteniendo la naturaleza abierta y

73
00:03:12,039 --> 00:03:13,439
hundiendo los costes operativos.

74
00:03:13,740 --> 00:03:14,759
Es que es de locos.

75
00:03:14,900 --> 00:03:17,180
Y la gran incógnita de toda la industria

76
00:03:17,180 --> 00:03:20,080
era entender qué narices había cambiado internamente en

77
00:03:20,080 --> 00:03:20,780
solo medio año.

78
00:03:20,960 --> 00:03:24,099
Y la respuesta técnica, esa arquitectura que llaman

79
00:03:24,099 --> 00:03:26,379
atención dispersa, es lo que se reveló en

80
00:03:26,379 --> 00:03:27,379
ese diagrama que decías.

81
00:03:27,520 --> 00:03:29,740
Lo publicó en la red social X el

82
00:03:29,740 --> 00:03:32,180
jefe de I más D, Skylar Miao, el

83
00:03:32,180 --> 00:03:32,939
26 de mayo.

84
00:03:33,560 --> 00:03:35,879
Bueno, a ver, antes de meternos en las

85
00:03:35,879 --> 00:03:38,400
matemáticas y en las entrañas de ese diagrama,

86
00:03:38,800 --> 00:03:40,620
yo creo que es vital que aterricemos un

87
00:03:40,620 --> 00:03:41,599
poco los conceptos.

88
00:03:42,280 --> 00:03:44,939
Necesitamos entender de qué es capaz el M3

89
00:03:44,939 --> 00:03:48,340
cuando, digamos, sale del laboratorio y se enfrenta

90
00:03:48,340 --> 00:03:49,120
a problemas de verdad.

91
00:03:49,460 --> 00:03:51,840
Sí, porque los ejemplos del vídeo son telita.

92
00:03:51,979 --> 00:03:54,659
Ya ves, van muchísimo más allá de generar

93
00:03:54,659 --> 00:03:55,719
textos bien escritos.

94
00:03:56,000 --> 00:03:57,719
Es que lo que marca la diferencia de

95
00:03:57,719 --> 00:04:00,860
entrada es que es multimodal de forma nativa.

96
00:04:00,979 --> 00:04:03,060
O sea, el M3 no es el típico

97
00:04:03,060 --> 00:04:05,099
modelo de lenguaje al que luego le pegan

98
00:04:05,099 --> 00:04:07,060
un módulo de visión con celo para salir

99
00:04:07,060 --> 00:04:07,460
del paso.

100
00:04:07,680 --> 00:04:08,699
No es un parche.

101
00:04:08,800 --> 00:04:10,860
Exacto, no es un parche.

102
00:04:10,960 --> 00:04:13,280
Se ha entrenado desde el día uno asimilando

103
00:04:13,280 --> 00:04:16,240
texto e imágenes juntos como un único flujo

104
00:04:16,240 --> 00:04:16,540
de información.

105
00:04:17,079 --> 00:04:19,339
Y el vídeo ilustra esto con una tarea

106
00:04:19,339 --> 00:04:21,339
que, a ver, parece súper mundana.

107
00:04:21,959 --> 00:04:23,639
Rellenar un formulario en blanco.

108
00:04:23,879 --> 00:04:24,879
Parece fácil, ¿eh?

109
00:04:24,980 --> 00:04:26,839
Parece facilísimo a simple vista.

110
00:04:27,079 --> 00:04:29,540
Pero el nivel de razonamiento espacial que requiere

111
00:04:29,540 --> 00:04:30,339
eso es altísimo.

112
00:04:30,540 --> 00:04:32,620
O sea, el modelo recibe la imagen de

113
00:04:32,620 --> 00:04:33,660
un papel que está vacío.

114
00:04:33,680 --> 00:04:36,240
Y tiene que deducir toda la estructura visual.

115
00:04:36,839 --> 00:04:38,680
Calcular las coordenadas exactas.

116
00:04:38,800 --> 00:04:40,079
De cada campo para escribir.

117
00:04:40,379 --> 00:04:42,759
Encajar el texto con un espaciado milimétrico.

118
00:04:42,939 --> 00:04:45,300
Claro, es que eso demuestra una comprensión súper

119
00:04:45,300 --> 00:04:47,519
profunda de cómo está diseñada la página.

120
00:04:47,939 --> 00:04:49,879
Y esto luego se ve directamente en los

121
00:04:49,879 --> 00:04:51,639
benchmarks, en los bancos de pruebas.

122
00:04:51,860 --> 00:04:54,519
En entornos súper exigentes como el SwayBench Pro,

123
00:04:54,660 --> 00:04:57,339
supera al GPT 5 .5 y al Yengini

124
00:04:57,339 --> 00:04:58,220
3 .1 Pro.

125
00:04:58,540 --> 00:05:00,839
Y en pruebas visuales e interactivas como el

126
00:05:00,839 --> 00:05:03,560
SVG Bench o el OS World, consigue batir

127
00:05:03,560 --> 00:05:04,779
al Opus 4 .7.

128
00:05:05,519 --> 00:05:08,240
Lo cual nos lleva a un terreno donde...

129
00:05:08,800 --> 00:05:10,199
El M3 me da la sensación de que

130
00:05:10,199 --> 00:05:12,100
brilla con todavía más intensidad.

131
00:05:12,199 --> 00:05:14,199
Que es la programación pura y dura.

132
00:05:14,420 --> 00:05:15,540
Ah, sí, eso es espectacular.

133
00:05:15,920 --> 00:05:18,120
En el vídeo, le piden al modelo crear

134
00:05:18,120 --> 00:05:20,379
un clon de la interfaz de Windows 11

135
00:05:20,379 --> 00:05:21,300
para el navegador.

136
00:05:21,459 --> 00:05:23,500
Y no te hace una fachada bonita que

137
00:05:23,500 --> 00:05:23,899
no hace nada.

138
00:05:24,120 --> 00:05:24,579
¿Qué va?

139
00:05:24,680 --> 00:05:24,939
¿Qué va?

140
00:05:25,019 --> 00:05:28,040
El modelo construye un sistema funcional para iniciar

141
00:05:28,040 --> 00:05:28,519
sesión.

142
00:05:28,920 --> 00:05:31,399
Programa una aplicación de Paint que funciona de

143
00:05:31,399 --> 00:05:31,680
verdad.

144
00:05:31,879 --> 00:05:34,220
E incluso mete un pequeño videojuego en 3D

145
00:05:34,220 --> 00:05:36,240
que puedes jugar desde esa interfaz.

146
00:05:36,300 --> 00:05:37,579
Todo de forma autónoma.

147
00:05:37,699 --> 00:05:38,779
¿Y el nivel de complejidad?

148
00:05:38,800 --> 00:05:39,959
El nivel de complejidad sube más cuando ves

149
00:05:39,959 --> 00:05:41,800
lo del simulador de la televisión de los

150
00:05:41,800 --> 00:05:42,360
años 90.

151
00:05:42,540 --> 00:05:44,939
O sea, no puso un vídeo cuadrado y

152
00:05:44,939 --> 00:05:45,259
ya está.

153
00:05:45,360 --> 00:05:49,720
Usó una librería gráfica bastante avanzada, 3 .js,

154
00:05:49,959 --> 00:05:53,180
para programar la curvatura cóncava exacta del cristal

155
00:05:53,180 --> 00:05:54,000
de la teledetubo.

156
00:05:54,199 --> 00:05:56,540
Aplicó físicas al entorno y simuló cómo se

157
00:05:56,540 --> 00:05:58,180
comporta el sonido en un espacio en tres

158
00:05:58,180 --> 00:05:58,899
dimensiones.

159
00:05:59,040 --> 00:05:59,899
¡Madre mía!

160
00:06:00,300 --> 00:06:03,339
Incluso con cosas súper tediosas, como programar gráficos

161
00:06:03,339 --> 00:06:05,379
vectoriales SVG línea por línea.

162
00:06:05,519 --> 00:06:08,500
Te genera un mando de PlayStation 4 perfecto.

163
00:06:08,800 --> 00:06:10,279
O te dibuja el horizonte de Nueva York

164
00:06:10,279 --> 00:06:11,839
con más de 2 .000 líneas de código.

165
00:06:12,040 --> 00:06:14,259
Sin usar trucos de relleno y manejando la

166
00:06:14,259 --> 00:06:15,779
transición de la luz entre el día y

167
00:06:15,779 --> 00:06:16,180
la noche.

168
00:06:16,360 --> 00:06:17,139
Es increíble.

169
00:06:17,300 --> 00:06:19,279
Pero fíjate, hay un ejemplo en el análisis

170
00:06:19,279 --> 00:06:21,180
que a mí me dejó totalmente perpleja.

171
00:06:21,259 --> 00:06:23,079
El caso de la optimización Zuda.

172
00:06:23,300 --> 00:06:25,120
Yo entiendo que es algo relacionado con el

173
00:06:25,120 --> 00:06:26,339
hardware, con las gráficas.

174
00:06:26,360 --> 00:06:28,860
Pero, a ver, ¿por qué es tan extraordinario

175
00:06:28,860 --> 00:06:29,779
este caso en concreto?

176
00:06:29,959 --> 00:06:33,199
Pues mira, optimizar CUDA es, para entenderlo fácil,

177
00:06:33,459 --> 00:06:36,620
escribir las instrucciones del nivel más bajo posible

178
00:06:36,620 --> 00:06:38,779
para que una tarjeta gráfica trabaje.

179
00:06:40,100 --> 00:06:43,339
Es un trabajo de ingeniería súper minucioso.

180
00:06:43,779 --> 00:06:45,259
Cada ciclo de reloj cuenta.

181
00:06:45,519 --> 00:06:45,879
Vale.

182
00:06:46,319 --> 00:06:49,339
Entonces, en el experimento, le dieron al M3

183
00:06:49,339 --> 00:06:51,600
un esquema súper básico de código en un

184
00:06:51,600 --> 00:06:53,019
lenguaje que se llama Triton.

185
00:06:53,180 --> 00:06:55,399
Le explicaron el objetivo y le dieron las

186
00:06:55,399 --> 00:06:56,079
herramientas.

187
00:06:56,139 --> 00:06:58,500
Pues el modelo se quedó operando solo, sin

188
00:06:58,500 --> 00:07:00,699
humanos de por medio, durante 24 horas.

189
00:07:00,899 --> 00:07:02,819
¿Y qué pasó en esas 24 horas?

190
00:07:03,079 --> 00:07:06,420
Pues que el M3 hizo 147 iteraciones.

191
00:07:06,600 --> 00:07:08,360
O sea, probaba, daba error.

192
00:07:08,800 --> 00:07:09,300
Se corregía.

193
00:07:09,519 --> 00:07:12,699
Analizó sus fallos, reescribió el código y pasó

194
00:07:12,699 --> 00:07:14,959
de usar el hardware al 7 ,6 %

195
00:07:14,959 --> 00:07:17,860
a un abrumador 71 ,3%.

196
00:07:17,860 --> 00:07:20,800
Él solo aceleró el proceso casi 10 veces.

197
00:07:20,959 --> 00:07:22,079
9 ,4 exactamente.

198
00:07:22,620 --> 00:07:23,120
¡Ostras!

199
00:07:23,319 --> 00:07:23,720
Claro.

200
00:07:24,589 --> 00:07:28,339
Esa capacidad de coger un problema gigante, descomponerlo,

201
00:07:28,399 --> 00:07:30,319
usar herramientas y automejorarse.

202
00:07:31,029 --> 00:07:33,839
Eso hasta hace nada era exclusivo de laboratorios

203
00:07:33,839 --> 00:07:35,620
cerrados con recursos infinitos.

204
00:07:35,819 --> 00:07:36,199
Ya.

205
00:07:36,589 --> 00:07:38,500
Es que viendo todo esto… A mí me

206
00:07:38,500 --> 00:07:40,079
surge una duda, que creo que es súper

207
00:07:40,079 --> 00:07:40,680
razonable.

208
00:07:40,839 --> 00:07:42,699
O sea, estamos ante un modelo que te

209
00:07:42,699 --> 00:07:45,439
procesa un millón de tokens de información, te

210
00:07:45,439 --> 00:07:48,899
ejecuta código de bajo nivel, razona sobre imágenes…

211
00:07:48,899 --> 00:07:51,800
¿Cómo es físicamente posible que un modelo de

212
00:07:51,800 --> 00:07:54,720
código abierto haga todo esto sin que los

213
00:07:54,720 --> 00:07:56,699
servidores ardan o sin que la factura sea

214
00:07:56,699 --> 00:07:57,100
un arruino?

215
00:07:57,279 --> 00:07:58,220
Ahí le has dado.

216
00:07:58,699 --> 00:08:01,360
Ese es exactamente el problema de la arquitectura

217
00:08:01,360 --> 00:08:01,819
tradicional.

218
00:08:02,420 --> 00:08:05,120
Si un modelo tiene que prestar atención completa

219
00:08:05,120 --> 00:08:07,319
a cada uno de ese millón de tokens,

220
00:08:07,319 --> 00:08:10,399
a la vez, en cada maldito paso, la

221
00:08:10,399 --> 00:08:12,279
carga crece de forma cuadrática.

222
00:08:12,480 --> 00:08:14,259
Es insostenible.

223
00:08:14,519 --> 00:08:15,360
Claro, se satura.

224
00:08:15,439 --> 00:08:15,980
Exacto.

225
00:08:15,980 --> 00:08:18,680
La solución de Minimax ha sido diseñar un

226
00:08:18,680 --> 00:08:22,180
sistema que es implacablemente selectivo.

227
00:08:22,399 --> 00:08:24,620
O sea, no procesan todo a lo bruto.

228
00:08:24,740 --> 00:08:28,040
Han aprendido a identificar rapidísimamente qué es lo

229
00:08:28,040 --> 00:08:28,899
que pueden ignorar.

230
00:08:29,180 --> 00:08:32,039
Y esto nos lleva de cabeza al diagrama

231
00:08:32,039 --> 00:08:32,919
de Skylar Miao.

232
00:08:33,139 --> 00:08:36,480
Porque entender esa imagen es entender cómo Nariz

233
00:08:36,480 --> 00:08:37,080
es funcional.

234
00:08:37,919 --> 00:08:41,000
Según el artículo de Hugging Face, el diagrama

235
00:08:41,000 --> 00:08:43,200
divide el proceso de atención en dos etapas

236
00:08:43,200 --> 00:08:44,799
que están súper separadas.

237
00:08:44,980 --> 00:08:47,279
La primera la llaman la rama del índice.

238
00:08:47,419 --> 00:08:49,559
Eso es, la Index Branch.

239
00:08:49,899 --> 00:08:52,299
El objetivo de esta primera rama es hacer

240
00:08:52,299 --> 00:08:54,399
un cribado preliminar de toda la información.

241
00:08:54,740 --> 00:08:57,500
Pero ojo, gastando la menor cantidad de energía

242
00:08:57,500 --> 00:08:57,960
posible.

243
00:08:58,580 --> 00:09:00,659
Para eso usan una base que se llama

244
00:09:00,659 --> 00:09:03,620
GQA, Atención de Consultas Agrupadas.

245
00:09:03,899 --> 00:09:06,879
Pero la magia matemática aquí es que, la

246
00:09:06,879 --> 00:09:09,320
clave de búsqueda, el famoso key del índice,

247
00:09:09,460 --> 00:09:11,740
se ha reducido a una única cabeza de

248
00:09:11,740 --> 00:09:13,480
atención compartida por todo el sistema.

249
00:09:13,799 --> 00:09:15,899
La memoria de este modelo es una biblioteca

250
00:09:15,899 --> 00:09:18,480
gigantesca con un millón de libros.

251
00:09:18,519 --> 00:09:19,379
Vale, me gusta.

252
00:09:19,539 --> 00:09:23,039
El enfoque antiguo, la atención completa, obligaría al

253
00:09:23,039 --> 00:09:25,500
investigador a leerse cada página de cada libro

254
00:09:25,500 --> 00:09:26,580
para encontrar un dato.

255
00:09:26,759 --> 00:09:29,159
Sí, un esfuerzo monumental y lentísimo.

256
00:09:29,480 --> 00:09:31,840
Entonces, lo que hace esta primera rama del

257
00:09:31,840 --> 00:09:34,639
índice sería algo así como enviar a un

258
00:09:34,639 --> 00:09:37,200
becario ultra rápido, que no abre los libros,

259
00:09:37,200 --> 00:09:39,820
sino que sólo corre por los pasillos leyendo

260
00:09:39,820 --> 00:09:42,259
los lomos y te selecciona cinco estanterías.

261
00:09:42,419 --> 00:09:44,320
Es la analogía perfecta, Cici.

262
00:09:44,480 --> 00:09:48,200
Y matemáticamente, este becario tuyo hace dos cosas.

263
00:09:48,679 --> 00:09:51,279
Primero, aplica una técnica que se llama Block

264
00:09:51,279 --> 00:09:51,919
Max Pool.

265
00:09:52,519 --> 00:09:55,940
Básicamente, coge las puntuaciones de palabras sueltas y

266
00:09:55,940 --> 00:09:58,360
las agrupa para evaluar bloques enteros de información.

267
00:09:59,120 --> 00:10:01,740
Siguiendo con tu biblioteca, en vez de puntuar

268
00:10:01,740 --> 00:10:04,379
páginas sueltas, puntúa las estanterías enteras.

269
00:10:04,500 --> 00:10:05,720
Claro, mucho más rápido.

270
00:10:05,919 --> 00:10:06,480
Muchísimo.

271
00:10:06,580 --> 00:10:08,980
Y luego usa una función de selección, el

272
00:10:08,980 --> 00:10:11,679
Top Key, para quedarse solo con las estanterías

273
00:10:11,679 --> 00:10:13,000
con la máxima puntuación.

274
00:10:13,279 --> 00:10:13,759
Vale.

275
00:10:13,860 --> 00:10:17,480
Entonces, una vez que el becario ha identificado

276
00:10:17,480 --> 00:10:20,940
esas pocas estanterías útiles, supongo que ahí es

277
00:10:20,940 --> 00:10:23,639
donde entra la segunda parte del diagrama, la

278
00:10:23,639 --> 00:10:24,500
rama dispersa.

279
00:10:24,840 --> 00:10:26,580
Exactamente, la Sparse Branch.

280
00:10:27,159 --> 00:10:29,700
Esta segunda etapa coge los índices que le

281
00:10:29,700 --> 00:10:31,580
dio la primera y saca de la memoria

282
00:10:31,580 --> 00:10:34,100
principal única y exclusivamente esos bloques.

283
00:10:34,100 --> 00:10:37,000
Y es solo en ese pequeño subconjunto donde

284
00:10:37,000 --> 00:10:39,779
el modelo ejecuta los cálculos pesados, la atención

285
00:10:39,779 --> 00:10:40,240
real.

286
00:10:40,840 --> 00:10:43,820
El investigador experto de tu biblioteca ya no

287
00:10:43,820 --> 00:10:44,940
mira el millón de libros.

288
00:10:44,940 --> 00:10:46,960
Se sienta a estudiar a fondo solo las

289
00:10:46,960 --> 00:10:48,539
cinco estanterías que le han traído.

290
00:10:48,679 --> 00:10:51,179
Y las cifras del artículo son abrumadoras.

291
00:10:51,440 --> 00:10:53,820
Dicen que al procesar ese contexto de un

292
00:10:53,820 --> 00:10:57,139
millón de tokens, el M3 es 9 ,7

293
00:10:57,139 --> 00:11:00,019
veces más rápido en la fase inicial, cuando

294
00:11:00,019 --> 00:11:00,799
lee los datos.

295
00:11:01,080 --> 00:11:03,820
Pero lo verdaderamente salvaje es la fase de

296
00:11:03,820 --> 00:11:04,080
generación.

297
00:11:04,080 --> 00:11:05,100
Sí.

298
00:11:05,340 --> 00:11:08,259
Afirman que es 15 ,6 veces más rápido

299
00:11:08,259 --> 00:11:09,320
escribiendo las respuestas.

300
00:11:10,059 --> 00:11:10,679
Es una locura.

301
00:11:10,940 --> 00:11:13,720
Y esa aceleración bestial al generar se debe

302
00:11:13,720 --> 00:11:15,159
de la gestión de la memoria caché.

303
00:11:15,259 --> 00:11:17,759
Al calcular la atención sobre un porcentaje tan

304
00:11:17,759 --> 00:11:20,440
minúsculo del contexto, la presión sobre la memoria

305
00:11:20,440 --> 00:11:21,539
del sistema se hunde.

306
00:11:21,860 --> 00:11:24,379
Los datos dicen que al generar, el M3

307
00:11:24,379 --> 00:11:26,320
interactúa solo con entre un 6 y un

308
00:11:26,320 --> 00:11:28,259
7 % de los bloques disponibles.

309
00:11:28,460 --> 00:11:30,620
O sea, que el modelo se permite el

310
00:11:30,620 --> 00:11:33,740
lujo de pasar olímpicamente de más del 90

311
00:11:33,740 --> 00:11:34,059
% de los bloques disponibles.

312
00:11:34,700 --> 00:11:37,559
Y el diseño inicial ya le ha achivado

313
00:11:37,559 --> 00:11:38,919
que ahí no hay nada útil.

314
00:11:39,120 --> 00:11:39,399
Claro.

315
00:11:39,919 --> 00:11:42,200
Y al no tener que estar cargando constantemente

316
00:11:42,200 --> 00:11:44,320
ese 90 % de basura en la memoria

317
00:11:44,320 --> 00:11:46,399
rápida y cara de los servidores, pues la

318
00:11:46,399 --> 00:11:47,480
velocidad se dispara.

319
00:11:47,600 --> 00:11:48,940
¿Por qué el diseño en dos etapas es

320
00:11:48,940 --> 00:11:50,580
tan maravillosamente eficiente?

321
00:11:50,899 --> 00:11:52,840
¿Por qué los gigantes de la industria no

322
00:11:52,840 --> 00:11:53,580
lo han hecho antes?

323
00:11:54,220 --> 00:11:56,440
El artículo, de hecho, menciona que gente como

324
00:11:56,440 --> 00:11:58,960
DeepSeek lleva tiempo explorando cosas parecidas, ¿no?

325
00:11:59,419 --> 00:12:00,759
Arquitecturas de atención nativa.

326
00:12:01,139 --> 00:12:03,419
Pero Minimax parece que ha tomado otro camino

327
00:12:03,419 --> 00:12:04,039
con este nuevo sistema.

328
00:12:04,059 --> 00:12:04,279
M3.

329
00:12:04,879 --> 00:12:07,480
Sí, y el contraste con DeepSeek es súper

330
00:12:07,480 --> 00:12:07,940
interesante.

331
00:12:08,340 --> 00:12:10,320
Es una clase magistral de cómo se hace

332
00:12:10,320 --> 00:12:12,259
IA ahora mismo, en 2026.

333
00:12:12,700 --> 00:12:16,000
DeepSeek buscaba una atención dispersa teóricamente perfecta.

334
00:12:16,019 --> 00:12:19,759
Un diseño súper exquisito matemáticamente, pero muy complejo

335
00:12:19,759 --> 00:12:20,679
de llevar al mundo real.

336
00:12:21,159 --> 00:12:23,720
Minimax, sin embargo, ha optado por el pragmatismo

337
00:12:23,720 --> 00:12:24,360
puro y duro.

338
00:12:24,440 --> 00:12:26,299
O sea, la ingeniería por delante de la

339
00:12:26,299 --> 00:12:26,700
teoría.

340
00:12:26,759 --> 00:12:29,220
Y para eso hicieron tres simplificaciones.

341
00:12:29,340 --> 00:12:31,740
Tres restas respecto a lo que hacía DeepSeek.

342
00:12:31,980 --> 00:12:32,279
Vale.

343
00:12:32,279 --> 00:12:34,919
Hablemos de la primera de esas restas.

344
00:12:35,059 --> 00:12:38,080
Hablan de usar GQA frente a formatos de

345
00:12:38,080 --> 00:12:40,519
compresión más extremos como el MLA que usa

346
00:12:40,519 --> 00:12:41,000
DeepSeek.

347
00:12:42,360 --> 00:12:44,500
¿Esto qué implica en el día a día?

348
00:12:44,779 --> 00:12:48,279
Pues mira, el formato MLA comprime genial, pero

349
00:12:48,279 --> 00:12:50,100
te obliga a escribir software a medida para

350
00:12:50,100 --> 00:12:51,480
que las gráficas lo entiendan.

351
00:12:51,700 --> 00:12:54,480
Al usar GQA, que es un estándar súper

352
00:12:54,480 --> 00:12:57,059
conocido, Minimax se aseguró de que su modelo

353
00:12:57,059 --> 00:12:59,620
fuera compatible desde el minuto uno con herramientas

354
00:12:59,620 --> 00:13:01,679
que la comunidad de código abierto lleva años

355
00:13:01,679 --> 00:13:02,100
puliendo.

356
00:13:02,279 --> 00:13:04,879
Cosas como Flash Attention o VLM.

357
00:13:05,080 --> 00:13:07,320
O sea que, en lugar de inventarse un

358
00:13:07,320 --> 00:13:09,220
formato nuevo que obligue a todo el mundo

359
00:13:09,220 --> 00:13:12,419
a actualizar sus sistemas, cogen piezas estándar súper

360
00:13:12,419 --> 00:13:15,019
rápidas y encajan a la perfección en los

361
00:13:15,019 --> 00:13:16,259
servidores que ya tiene la gente.

362
00:13:16,559 --> 00:13:17,120
Exacto.

363
00:13:17,120 --> 00:13:19,860
Es ingeniería pensada para que la adopción sea

364
00:13:19,860 --> 00:13:20,759
fácil y estable.

365
00:13:21,100 --> 00:13:23,840
Y la segunda simplificación va de cómo tratan

366
00:13:23,840 --> 00:13:25,700
esa información que ya han seleccionado.

367
00:13:26,279 --> 00:13:29,120
Algunos rivales cogen los datos filtrados y los

368
00:13:29,120 --> 00:13:31,399
vuelven a comprimir para rascar un poquito más

369
00:13:31,399 --> 00:13:31,919
de memoria.

370
00:13:32,279 --> 00:13:34,279
Que supongo que eso tiene un riesgo, ¿no?

371
00:13:34,360 --> 00:13:36,940
Es como cuando guardas un JPG veinte veces

372
00:13:36,940 --> 00:13:38,399
y se acaba viendo borroso.

373
00:13:38,620 --> 00:13:39,980
Pierdes calidad en la respuesta.

374
00:13:40,360 --> 00:13:40,860
Sí, sí.

375
00:13:40,919 --> 00:13:42,419
Es una muy buena forma de verlo.

376
00:13:42,600 --> 00:13:45,539
El M3 selecciona por bloques, pero una vez

377
00:13:45,539 --> 00:13:47,639
que tiene el bloque, hace los cálculos sobre

378
00:13:47,639 --> 00:13:50,320
los datos crudos, los datos originales completos.

379
00:13:51,039 --> 00:13:54,460
Prefirieron sacrificar un pellizquito de eficiencia teórica para

380
00:13:54,460 --> 00:13:56,740
asegurarse de que el modelo no perdiera matices

381
00:13:56,740 --> 00:13:59,399
ni capacidad matemática en las respuestas difíciles.

382
00:13:59,460 --> 00:14:02,179
Me parece fascinante ver cómo han ido podando.

383
00:14:02,279 --> 00:14:06,080
Pero la tercera simplificación, fíjate, me parece la

384
00:14:06,080 --> 00:14:07,139
más radical de todas.

385
00:14:07,840 --> 00:14:11,120
Literalmente, han extirpado partes enteras del diseño original.

386
00:14:11,519 --> 00:14:14,320
Hablan de eliminar la ventana deslizante y la

387
00:14:14,320 --> 00:14:15,259
rana de compresión.

388
00:14:15,340 --> 00:14:16,919
A ver, ¿qué es eso de la ventana

389
00:14:16,919 --> 00:14:18,419
deslizante y por qué se la cargan?

390
00:14:18,740 --> 00:14:22,159
A ver, en muchos modelos modernos, la ventana

391
00:14:22,159 --> 00:14:23,919
deslizante es como un mecanismo de seguridad.

392
00:14:24,399 --> 00:14:26,679
Obliga al sistema a tener siempre en la

393
00:14:26,679 --> 00:14:29,419
memoria activa, a corto plazo, las últimas palabras

394
00:14:29,419 --> 00:14:30,320
de la conversación.

395
00:14:30,399 --> 00:14:30,960
Siempre.

396
00:14:30,960 --> 00:14:33,700
Porque asumen que el contexto inmediato es importante,

397
00:14:34,019 --> 00:14:36,779
es útil, pero gasta recursos todo el rato.

398
00:14:36,940 --> 00:14:39,419
Y Minimax dijo, mira, esto sobra.

399
00:14:39,700 --> 00:14:40,179
Básicamente.

400
00:14:40,899 --> 00:14:42,759
Concluyeron que si tu becario de la biblioteca

401
00:14:42,759 --> 00:14:44,740
hace un trabajo lo bastante bueno y rápido

402
00:14:44,740 --> 00:14:47,019
indexando, ya no te hace falta cargar con

403
00:14:47,019 --> 00:14:48,460
ese contexto fijo por si acaso.

404
00:14:48,539 --> 00:14:50,639
Si algo de hace cinco segundos es importante,

405
00:14:50,980 --> 00:14:52,159
el índice lo va a pillar.

406
00:14:52,340 --> 00:14:53,539
Si no, a la basura.

407
00:14:53,700 --> 00:14:57,039
Es como quitarle el aire acondicionado al coche

408
00:14:57,039 --> 00:14:57,600
de carreras.

409
00:14:57,940 --> 00:14:58,460
Exacto.

410
00:14:58,460 --> 00:15:00,720
Le quitas los asientos traseros y el aire

411
00:15:00,720 --> 00:15:01,379
acondicionado.

412
00:15:01,740 --> 00:15:03,899
Presindes del confort porque lo único que quieres

413
00:15:03,899 --> 00:15:05,860
es hacer la vuelta rápida en el circuito.

414
00:15:06,019 --> 00:15:08,240
Es que este planteamiento choca muchísimo con la

415
00:15:08,240 --> 00:15:10,100
tendencia que vemos en la industria, ¿no?

416
00:15:10,360 --> 00:15:12,600
Llevamos años que parece que cada modelo nuevo

417
00:15:12,600 --> 00:15:15,500
presume de meter más capas, sumar billones de

418
00:15:15,500 --> 00:15:17,759
parámetros, hacer todo más inescrutable.

419
00:15:18,019 --> 00:15:21,360
Y resulta que Minimax destrona los sistemas privativos

420
00:15:21,360 --> 00:15:22,620
quitándole piezas al motor.

421
00:15:22,879 --> 00:15:23,139
Sí.

422
00:15:23,220 --> 00:15:25,679
Es un síntoma de madurez técnica, yo creo.

423
00:15:25,799 --> 00:15:28,100
Han entendido que no se trata de deslumbrar

424
00:15:28,100 --> 00:15:28,440
con un auto.

425
00:15:28,440 --> 00:15:30,019
No es una teoría perfecta en el laboratorio,

426
00:15:30,080 --> 00:15:32,080
sino de crear un sistema que vaya como

427
00:15:32,080 --> 00:15:34,480
un tiro hoy, que cueste dos duros y

428
00:15:34,480 --> 00:15:36,600
que funcione con el software que los programadores

429
00:15:36,600 --> 00:15:38,000
ya tienen en sus portátiles.

430
00:15:38,600 --> 00:15:40,879
La factura del servidor se desploma.

431
00:15:41,080 --> 00:15:43,980
Y el análisis detalla unos precios que están

432
00:15:43,980 --> 00:15:46,620
literalmente sacudiendo todo el ecosistema.

433
00:15:46,860 --> 00:15:48,700
Las cifras son para echarse a temblar si

434
00:15:48,700 --> 00:15:49,559
eres la competencia.

435
00:15:49,940 --> 00:15:52,000
Procesar un millón de tokens de entrada con

436
00:15:52,000 --> 00:15:54,379
el M3 cuesta ahora mismo 30 centavos de

437
00:15:54,379 --> 00:15:54,720
dólar.

438
00:15:54,820 --> 00:15:57,299
Y generar un millón de salida, un dólar

439
00:15:57,299 --> 00:15:57,679
con 20.

440
00:15:58,440 --> 00:15:59,139
Es que es ridículo.

441
00:15:59,379 --> 00:16:01,539
Y encima mencionan un plan mensual de 20

442
00:16:01,539 --> 00:16:03,419
dólares que te da acceso a unos 1700

443
00:16:03,419 --> 00:16:04,720
millones de tokens.

444
00:16:05,100 --> 00:16:06,740
Si tú comparas eso con lo que te

445
00:16:06,740 --> 00:16:09,299
costaba hacer análisis masivos con los modelos privativos

446
00:16:09,299 --> 00:16:12,019
grandes, vamos, la diferencia es abismal.

447
00:16:12,059 --> 00:16:14,159
Te podías fundir el presupuesto del mes en

448
00:16:14,159 --> 00:16:14,600
dos días.

449
00:16:14,820 --> 00:16:18,379
Y este abaratamiento tan radical nos lleva a

450
00:16:18,379 --> 00:16:21,000
una de las conclusiones clave del artículo de

451
00:16:21,000 --> 00:16:21,500
Hugging Face.

452
00:16:22,000 --> 00:16:24,320
Ellos apuntan a que ahora, en esta segunda

453
00:16:24,320 --> 00:16:28,139
mitad de 2026, procesar un millón de tokens,

454
00:16:28,440 --> 00:16:30,019
va a dejar de ser un lujo de

455
00:16:30,019 --> 00:16:30,700
corporaciones.

456
00:16:30,799 --> 00:16:32,940
Ya no es el reclamo publicitario de las

457
00:16:32,940 --> 00:16:33,960
grandes tecnológicas.

458
00:16:34,179 --> 00:16:34,879
Para nada.

459
00:16:34,879 --> 00:16:36,100
Va a ser la línea base.

460
00:16:36,539 --> 00:16:37,019
Exacto.

461
00:16:37,019 --> 00:16:38,159
El estándar mínimo.

462
00:16:38,500 --> 00:16:40,899
Y es profundamente democratizador, la verdad.

463
00:16:41,259 --> 00:16:44,539
Pensar que cualquier desarrollador indie, desde su habitación,

464
00:16:44,720 --> 00:16:47,460
tiene ahora la capacidad de cargar decenas de

465
00:16:47,460 --> 00:16:48,639
libros de texto de golpe.

466
00:16:48,799 --> 00:16:50,600
O pedirle a un agente que le revise

467
00:16:50,600 --> 00:16:52,059
el código de todo un proyecto.

468
00:16:52,299 --> 00:16:53,559
O crear simuladores.

469
00:16:53,720 --> 00:16:55,620
Y todo sin pánico a la factura de

470
00:16:55,620 --> 00:16:56,100
fin de mes.

471
00:16:56,259 --> 00:16:56,940
Sí, sí.

472
00:16:56,940 --> 00:16:59,200
Es que la barrera económica de entrada a

473
00:16:59,200 --> 00:17:01,799
la innovación altísima se ha evaporado.

474
00:17:01,960 --> 00:17:03,879
Y el motor de esa democratización no ha

475
00:17:03,879 --> 00:17:06,599
sido montar un superordenador más grande, ¿sabes?

476
00:17:06,680 --> 00:17:09,619
Ha sido la inteligencia minimalista de este diseño

477
00:17:09,619 --> 00:17:10,660
de atención dispersa.

478
00:17:11,000 --> 00:17:14,019
Ha demostrado que con ingenio y quitando fricción

479
00:17:14,019 --> 00:17:16,319
técnica le puedes ganar a la fuerza bruta

480
00:17:16,319 --> 00:17:17,640
de computación de los gigantes.

481
00:17:17,839 --> 00:17:18,299
Totalmente.

482
00:17:18,680 --> 00:17:21,720
Es el triunfo del diseño inteligente sobre la

483
00:17:21,720 --> 00:17:22,039
billetera.

484
00:17:22,880 --> 00:17:25,279
Y bueno, todo esto invita a una reflexión

485
00:17:25,279 --> 00:17:27,380
final, que creo que es casi una advertencia

486
00:17:27,380 --> 00:17:28,000
para el sector.

487
00:17:28,279 --> 00:17:31,200
O sea, si una arquitectura destilada, guiada por

488
00:17:31,200 --> 00:17:34,079
un pragmatismo tan estricto y lanzada en código

489
00:17:34,079 --> 00:17:36,859
abierto, puede generar un modelo que se automejora,

490
00:17:36,859 --> 00:17:38,940
como lo que vimos de CUDA, y que

491
00:17:38,940 --> 00:17:41,380
supera en los test a los laboratorios herméticos

492
00:17:41,380 --> 00:17:44,400
que tienen dinero infinito, pues cabe preguntarse cuál

493
00:17:44,400 --> 00:17:46,579
es el verdadero foso defensivo de las grandes

494
00:17:46,579 --> 00:17:47,839
corporaciones a día de hoy.

495
00:17:48,359 --> 00:17:51,039
¿Queda alguna ventaja estructural que el mundo abierto

496
00:17:51,039 --> 00:17:51,920
no pueda replicar?

497
00:17:52,079 --> 00:17:53,759
¿O estamos ya en ese punto de no

498
00:17:53,759 --> 00:17:57,220
retorno donde la innovación transparente y distribuida se

499
00:17:57,220 --> 00:17:59,259
vuelve irreversiblemente mejor que la cerrada?

500
00:17:59,539 --> 00:18:01,819
Pues mira, yo creo que esa es sin

501
00:18:01,819 --> 00:18:04,240
duda la gran pregunta estratégica que define dónde

502
00:18:04,240 --> 00:18:06,000
estamos en la tecnología hoy en día.

503
00:18:06,140 --> 00:18:06,680
Desde luego.

504
00:18:06,819 --> 00:18:09,400
Ahí dejamos esa incógnita flotando.

505
00:18:10,000 --> 00:18:13,079
Antes de despedirnos hasta el próximo programa, os

506
00:18:13,079 --> 00:18:14,920
informamos de que las voces que oyes han

507
00:18:14,920 --> 00:18:16,960
sido generadas por la IA de Notebook LM

508
00:18:16,960 --> 00:18:19,720
y que dirigiendo el podcast se encuentra Julio

509
00:18:19,720 --> 00:18:22,140
Pablo Vázquez, un humano que te envía saludos.

510
00:18:22,180 --> 00:18:24,940
En caso de error, probablemente sean errores humanos.

511
00:18:25,240 --> 00:18:26,140
Nos escuchamos.

512
00:18:27,059 --> 00:18:39,200
Y hasta aquí el episodio de hoy.

513
00:18:39,299 --> 00:18:41,119
Muchas gracias por tu atención.

514
00:18:50,549 --> 00:18:52,569
Esto es BIMPRAXIS.

515
00:18:52,809 --> 00:18:55,329
Nos escuchamos en el próximo episodio.

