1
00:00:09,679 --> 00:00:15,660
Buenas, esto es BIMPRAXIS, el podcast donde el

2
00:00:15,660 --> 00:00:17,739
BIM se encuentra con la inteligencia artificial.

3
00:00:20,260 --> 00:00:23,500
Exploramos la ciencia, la tecnología y el futuro

4
00:00:23,500 --> 00:00:26,420
desde el enfoque de la arquitectura, ingeniería y

5
00:00:26,420 --> 00:00:27,120
construcción.

6
00:00:28,719 --> 00:00:29,440
¡Empezamos!

7
00:00:36,909 --> 00:00:40,469
Muy buenas, bienvenidas, bienvenidos a un nuevo episodio

8
00:00:40,469 --> 00:00:41,409
de BIMPRAXIS.

9
00:00:41,549 --> 00:00:44,590
Hoy os traemos el revolucionario coste de IA

10
00:00:44,590 --> 00:00:45,810
por kilovatio.

11
00:00:45,810 --> 00:00:46,710
¿Estáis listos?

12
00:00:46,729 --> 00:00:48,049
Pues entramos en materia.

13
00:00:48,450 --> 00:00:50,850
Bueno, a ver, imaginemos por un momento una

14
00:00:50,850 --> 00:00:51,210
situación.

15
00:00:51,590 --> 00:00:52,310
Te escucho.

16
00:00:52,469 --> 00:00:54,490
Le pedimos a un modelo de inteligencia artificial

17
00:00:54,490 --> 00:00:57,490
que reescriba por completo una base de código

18
00:00:57,490 --> 00:00:58,030
inmensa.

19
00:00:58,189 --> 00:00:59,590
Que eso ya de por sí es un

20
00:00:59,590 --> 00:01:00,310
reto importante.

21
00:01:00,969 --> 00:01:01,490
Exacto.

22
00:01:01,490 --> 00:01:03,490
Le exigimos que la lea una y otra

23
00:01:03,490 --> 00:01:07,730
vez, analizando la arquitectura, proponiendo cambios y procesando

24
00:01:07,730 --> 00:01:10,049
casi 20 millones de palabras de ida y

25
00:01:10,049 --> 00:01:10,310
vuelta.

26
00:01:10,590 --> 00:01:12,670
Una barbaridad de datos, o sea, un volumen

27
00:01:12,670 --> 00:01:12,989
industrial.

28
00:01:13,349 --> 00:01:15,689
Pues fíjate, la locura es que, al terminar,

29
00:01:15,810 --> 00:01:18,950
la factura final que llega es literalmente lo

30
00:01:18,950 --> 00:01:19,989
que cuesta un café solo.

31
00:01:20,230 --> 00:01:20,890
¡Madre mía!

32
00:01:20,969 --> 00:01:23,510
Sí, sí, unos 2 dólares con 70 centavos.

33
00:01:23,670 --> 00:01:25,469
Y, a ver, esto no es un escenario

34
00:01:25,469 --> 00:01:27,650
de ciencia ficción para la próxima década.

35
00:01:27,689 --> 00:01:28,030
No que va.

36
00:01:29,189 --> 00:01:31,569
Principalmente porque rompe con todo lo que asumíamos

37
00:01:31,569 --> 00:01:33,269
sobre la economía de la computación.

38
00:01:33,370 --> 00:01:34,969
O sea, con las reglas básicas.

39
00:01:35,390 --> 00:01:35,829
Totalmente.

40
00:01:36,090 --> 00:01:38,609
Normalmente, en este sector, pues, debatimos sobre teorías

41
00:01:38,609 --> 00:01:40,790
abstractas o proyecciones a 5 años vista.

42
00:01:41,209 --> 00:01:43,510
Pero lo que tenemos sobre la mesa hoy

43
00:01:43,510 --> 00:01:44,730
son facturas reales.

44
00:01:44,870 --> 00:01:45,650
Dinero de verdad.

45
00:01:45,810 --> 00:01:46,510
Exacto.

46
00:01:47,290 --> 00:01:49,590
Desarrolladores independientes que están operando con márgenes de

47
00:01:49,590 --> 00:01:51,730
coste que, a primera vista, parecen un fallo

48
00:01:51,730 --> 00:01:53,989
flagrante en el sistema de facturación del proveedor.

49
00:01:54,030 --> 00:01:55,650
O sea que parece que se han equivocado

50
00:01:55,650 --> 00:01:56,290
al cobrarles.

51
00:01:56,670 --> 00:01:57,250
Eso es.

52
00:01:57,370 --> 00:01:59,609
Y claro, para comprender el terremoto que esto

53
00:01:59,609 --> 00:02:03,189
supone, necesitamos destripar cómo interactúan, pues, la física

54
00:02:03,189 --> 00:02:05,310
del hardware, la eficiencia del software y un

55
00:02:05,310 --> 00:02:08,210
modelo comercial que, fíjate, desafía directamente a los

56
00:02:08,210 --> 00:02:09,229
gigantes de Silicon Valley.

57
00:02:09,449 --> 00:02:11,210
Pues vamos a empezar por el origen del

58
00:02:11,210 --> 00:02:13,349
revuelo, porque el contexto aquí lo es todo.

59
00:02:14,169 --> 00:02:15,090
¿Qué es lo que se está haciendo?

60
00:02:15,349 --> 00:02:15,789
¿Qué es lo que se está haciendo?

61
00:02:15,789 --> 00:02:17,689
Es un proyecto de Reddit, concretamente en la

62
00:02:17,689 --> 00:02:19,310
comunidad OpenCodeKlee.

63
00:02:19,729 --> 00:02:24,449
Un desarrollador que utiliza el seudónimo Purplenipis compartió

64
00:02:24,449 --> 00:02:26,550
una captura de pantalla de su uso diario

65
00:02:26,550 --> 00:02:28,490
que dejó a todo el mundo boquiabierto.

66
00:02:28,729 --> 00:02:29,949
No es para menos, claro.

67
00:02:30,169 --> 00:02:32,449
Es que este usuario estaba trabajando con el

68
00:02:32,449 --> 00:02:35,889
modelo GLM 5 .2 utilizando una herramienta que

69
00:02:35,889 --> 00:02:39,110
se llama OpenCodeCode y el objetivo era sumamente

70
00:02:39,110 --> 00:02:39,810
intensivo.

71
00:02:39,949 --> 00:02:42,469
Sí, querían refactorizar un proyecto personal de tamaño

72
00:02:42,469 --> 00:02:43,069
medio, ¿verdad?

73
00:02:43,389 --> 00:02:43,909
Exacto.

74
00:02:43,909 --> 00:02:45,770
Usando una habilidad técnica muy especializada.

75
00:02:45,770 --> 00:02:48,669
Una habilidad específica llamada Improved Codebase Architecture que

76
00:02:48,669 --> 00:02:51,069
fue diseñada originalmente por Matt Pocock.

77
00:02:51,189 --> 00:02:53,710
Claro, y eso es importante recalcarlo.

78
00:02:53,849 --> 00:02:55,550
Sí, porque no le estaba pidiendo a la

79
00:02:55,550 --> 00:02:57,430
IA que escribiera un simple bloque de texto,

80
00:02:57,590 --> 00:02:57,710
¿no?

81
00:02:57,830 --> 00:02:58,669
¿Qué va, qué va?

82
00:02:58,870 --> 00:03:02,030
Le estaba exigiendo que iterara sobre una arquitectura

83
00:03:02,030 --> 00:03:07,370
de código compleja, evaluando dependencias, reestructurando toda la

84
00:03:07,370 --> 00:03:09,289
lógica profunda de la aplicación.

85
00:03:09,550 --> 00:03:12,069
Y ese tipo de tareas, a ver, tradicionalmente

86
00:03:12,069 --> 00:03:14,069
es un pozo sin fondo por el consumo

87
00:03:14,069 --> 00:03:14,530
de tokens.

88
00:03:14,750 --> 00:03:14,990
Claro.

89
00:03:15,770 --> 00:03:17,030
Si pides a un modelo que mejore una

90
00:03:17,030 --> 00:03:19,789
arquitectura completa, no puedes simplemente mirar el archivo

91
00:03:19,789 --> 00:03:21,509
suelto en el que estás trabajando.

92
00:03:21,789 --> 00:03:23,229
Tiene que ver la foto grande.

93
00:03:23,750 --> 00:03:24,229
Exactamente.

94
00:03:24,310 --> 00:03:26,289
Tiene que cargar en su memoria el contexto

95
00:03:26,289 --> 00:03:27,330
entero del proyecto.

96
00:03:27,530 --> 00:03:29,509
Y cada vez que hace un pequeño ajuste,

97
00:03:29,550 --> 00:03:32,689
necesita releer y revaluar cómo ese cambio afecta

98
00:03:32,689 --> 00:03:34,310
al resto del ecosistema de tu código.

99
00:03:34,590 --> 00:03:36,889
O sea, un proceso iterativo masivo.

100
00:03:37,090 --> 00:03:37,669
Sí, sí.

101
00:03:37,750 --> 00:03:39,810
Y los números que reporta este usuario en

102
00:03:39,810 --> 00:03:42,090
Reddit reflejan exactamente esa carga de trabajo.

103
00:03:42,469 --> 00:03:45,509
Hablamos de 19 ,2 millones de tokens consumidos,

104
00:03:45,770 --> 00:03:47,009
en un solo día de desarrollo.

105
00:03:47,310 --> 00:03:48,729
Yo me quedé impactada.

106
00:03:48,830 --> 00:03:50,550
Quiero que nos detengamos un momento en ese

107
00:03:50,550 --> 00:03:52,530
número para dimensionarlo correctamente.

108
00:03:53,090 --> 00:03:56,569
Consumir 19 millones de tokens por menos de

109
00:03:56,569 --> 00:03:59,030
tres dólares es, a ver, es una escala

110
00:03:59,030 --> 00:04:01,250
de asimilación de datos casi absurda.

111
00:04:01,370 --> 00:04:01,669
Sí.

112
00:04:01,990 --> 00:04:04,389
Sería el equivalente a entrar en la biblioteca

113
00:04:04,389 --> 00:04:07,169
central de una gran universidad, pedirle a un

114
00:04:07,169 --> 00:04:10,669
asistente que devore absolutamente todos los libros de

115
00:04:10,669 --> 00:04:13,449
la sección de ingeniería informática en segundos.

116
00:04:13,669 --> 00:04:15,050
Madre mía, la imagen es buena.

117
00:04:15,770 --> 00:04:18,029
Es de toda esa información para reescribir tu

118
00:04:18,029 --> 00:04:19,610
propia tesis doctoral desde cero.

119
00:04:19,649 --> 00:04:21,790
Y al salir, pues dejarle unas monedas de

120
00:04:21,790 --> 00:04:22,149
propina.

121
00:04:22,269 --> 00:04:22,930
Es que es tal cual.

122
00:04:23,149 --> 00:04:25,990
Es un volumen que rompe nuestros esquemas actuales.

123
00:04:26,069 --> 00:04:28,870
De hecho, el propio usuario hizo la comparativa

124
00:04:28,870 --> 00:04:31,089
usando los precios estándar del mercado a través

125
00:04:31,089 --> 00:04:33,189
de Open Router para ese mismo modelo, el

126
00:04:33,189 --> 00:04:34,550
GLM 5 .2.

127
00:04:34,689 --> 00:04:35,610
¿Y cuánto salía ahí?

128
00:04:35,750 --> 00:04:39,129
Pues en un escenario tradicional, esa misma refactorización

129
00:04:39,129 --> 00:04:42,790
habría costado unos ocho dólares con tres centavos.

130
00:04:42,870 --> 00:04:43,269
Guau.

131
00:04:43,350 --> 00:04:45,209
Y eso asumiendo que los precios de Open

132
00:04:45,209 --> 00:04:46,850
Router ya son competitivos, claro.

133
00:04:47,009 --> 00:04:47,470
Claro, claro.

134
00:04:47,629 --> 00:04:50,529
Además, un aspecto crucial que menciona este desarrollador

135
00:04:50,529 --> 00:04:53,910
es la percepción de la calidad y la

136
00:04:53,910 --> 00:04:54,350
velocidad.

137
00:04:54,730 --> 00:04:57,490
Ajá, porque si es barato pero lento, no

138
00:04:57,490 --> 00:04:58,110
sirve de mucho.

139
00:04:58,490 --> 00:04:59,089
Exacto.

140
00:04:59,089 --> 00:05:02,750
Pero empíricamente, este usuario compara la experiencia de

141
00:05:02,750 --> 00:05:05,329
usar este modelo en esta plataforma con correr

142
00:05:05,329 --> 00:05:07,250
Opus 4 .6 en alto.

143
00:05:07,470 --> 00:05:09,689
O sea, niveles máximos de rendimiento.

144
00:05:10,009 --> 00:05:10,790
Eso es.

145
00:05:10,889 --> 00:05:13,350
No estamos ante un servicio de bajo coste

146
00:05:13,350 --> 00:05:15,589
que tarda minutos en hacer o que te

147
00:05:15,589 --> 00:05:16,870
devuelve un código inservible.

148
00:05:17,110 --> 00:05:19,790
Y fíjate, cuando el coste de la inferencia

149
00:05:19,790 --> 00:05:22,009
de alta calidad se desploma de esta manera,

150
00:05:22,209 --> 00:05:26,050
la viabilidad matemática de cómo construimos software cambia

151
00:05:26,050 --> 00:05:26,829
radicalmente.

152
00:05:26,970 --> 00:05:28,790
O sea, ya no tienes miedo a equivocarte.

153
00:05:29,209 --> 00:05:29,689
Exacto.

154
00:05:29,810 --> 00:05:32,649
El desarrollo asistido por IA deja de ser

155
00:05:32,649 --> 00:05:35,709
una consulta quirúrgica y súper cuidadosa para no

156
00:05:35,709 --> 00:05:36,709
gastar presupuesto.

157
00:05:36,889 --> 00:05:39,750
Claro, que antes lo pensabas dos veces antes

158
00:05:39,750 --> 00:05:40,649
de darle al intro.

159
00:05:41,050 --> 00:05:41,529
Totalmente.

160
00:05:41,649 --> 00:05:43,910
Se convierte en un motor contimo de prueba

161
00:05:43,910 --> 00:05:44,290
y error.

162
00:05:44,949 --> 00:05:47,110
Puedes pedirle al modelo que genere 20 versiones

163
00:05:47,110 --> 00:05:50,189
diferentes de un mismo módulo, descartar 19 y

164
00:05:50,189 --> 00:05:51,889
no sentir que estás quemando billetes.

165
00:05:52,189 --> 00:05:56,170
Pero claro, semejante descuento monumental nos surge por

166
00:05:56,170 --> 00:05:57,029
arte de magia.

167
00:05:57,189 --> 00:05:59,790
A ver, las empresas no regalan capacidad de

168
00:05:59,790 --> 00:06:00,269
computo.

169
00:06:00,310 --> 00:06:01,430
No, desde luego.

170
00:06:01,689 --> 00:06:04,589
Tiene que haber una mecánica técnica muy afinada

171
00:06:04,589 --> 00:06:06,149
que sostenga esto financieramente.

172
00:06:06,449 --> 00:06:09,029
Y si miramos el desglose exacto de esos

173
00:06:09,029 --> 00:06:11,529
19 millones de tokens en la factura de

174
00:06:11,529 --> 00:06:15,550
nuestro protagonista, encontramos la primera revelación.

175
00:06:15,629 --> 00:06:16,170
A ver.

176
00:06:16,509 --> 00:06:20,110
Resulta que 17 millones de esos tokens fueron

177
00:06:20,110 --> 00:06:23,149
etiquetados como tokens de entrada en caché.

178
00:06:23,250 --> 00:06:24,730
Ajá, ahí está la clave.

179
00:06:24,990 --> 00:06:28,050
Solo 1 ,9 millones fueron de entrada regular

180
00:06:28,050 --> 00:06:32,110
y apenas 192 .900 fueron de salida.

181
00:06:32,290 --> 00:06:33,689
Un contraste brutal.

182
00:06:34,230 --> 00:06:36,410
Es que otros usuarios en el mismo hilo,

183
00:06:36,449 --> 00:06:39,370
como uno llamado Luke, reportaban tasas de acierto

184
00:06:39,370 --> 00:06:41,589
de la caché de entre el 89 y

185
00:06:41,589 --> 00:06:42,850
el 94 por ciento.

186
00:06:43,709 --> 00:06:46,269
Confieso que esas cifras me parecen magia negra.

187
00:06:46,490 --> 00:06:48,129
Es normal que te lo parezca.

188
00:06:48,389 --> 00:06:51,310
¿Qué es exactamente esta caché a nivel técnico

189
00:06:51,310 --> 00:06:53,589
y cómo logran un porcentaje de acierto tan

190
00:06:53,589 --> 00:06:54,069
salvaje?

191
00:06:54,490 --> 00:06:57,730
Bueno, la explicación reside en cómo funciona la

192
00:06:57,730 --> 00:07:00,430
memoria a corto plazo de estos modelos, lo

193
00:07:00,430 --> 00:07:03,110
que conocemos como la caché KV o Key

194
00:07:03,110 --> 00:07:03,689
Value Catch.

195
00:07:04,009 --> 00:07:04,430
¿Vale?

196
00:07:05,089 --> 00:07:07,189
Usemos una analogía del mundo de la alta

197
00:07:07,189 --> 00:07:08,649
cocina para que se entienda mejor.

198
00:07:08,949 --> 00:07:09,370
Me gusta.

199
00:07:09,509 --> 00:07:10,009
A ver.

200
00:07:10,410 --> 00:07:12,870
Imagina que un chef con estrella tiene que

201
00:07:12,870 --> 00:07:15,189
preparar un plato extremadamente complejo.

202
00:07:15,490 --> 00:07:17,470
Si cada vez que le piden el plato

203
00:07:17,470 --> 00:07:19,269
tiene que ir a la huerta a recoger

204
00:07:19,269 --> 00:07:23,129
las verduras, lavarlas, cortarlas y preparar las salsas

205
00:07:23,129 --> 00:07:25,569
base desde cero, el tiempo y el esfuerzo

206
00:07:25,569 --> 00:07:26,250
son enormes.

207
00:07:26,790 --> 00:07:28,490
Inviables para un restaurante, claro.

208
00:07:28,730 --> 00:07:30,870
Eso sería procesar tokens regulares.

209
00:07:31,290 --> 00:07:33,189
Pero ¿qué pasa si tiene un equipo de

210
00:07:33,189 --> 00:07:36,009
ayudantes que ya ha preprocesado, pesado y ordenado

211
00:07:36,009 --> 00:07:37,949
todos los ingredientes en la mesa de trabajo?

212
00:07:38,350 --> 00:07:40,850
Pues que el chef solo tiene que ejecutar

213
00:07:40,850 --> 00:07:41,610
la receta final.

214
00:07:41,889 --> 00:07:42,370
Exacto.

215
00:07:42,850 --> 00:07:45,370
La caché KV hace exactamente eso con el

216
00:07:45,370 --> 00:07:46,730
contexto matemático del código.

217
00:07:47,069 --> 00:07:47,550
Entiendo.

218
00:07:47,949 --> 00:07:50,269
Entonces, como la base de código del proyecto,

219
00:07:50,350 --> 00:07:52,730
digamos, no cambia en su gran mayoría entre

220
00:07:52,730 --> 00:07:53,990
una petición y la siguiente.

221
00:07:54,290 --> 00:07:55,529
El sistema no la vuelve a leer.

222
00:07:55,970 --> 00:07:56,449
Exactamente.

223
00:07:56,709 --> 00:08:00,290
Al refactorizar, el contexto principal, o sea, los

224
00:08:00,290 --> 00:08:02,850
cientos de archivos de tu proyecto, pues permanece

225
00:08:02,850 --> 00:08:03,250
estático.

226
00:08:03,430 --> 00:08:05,689
Lo único que cambia es el pequeño prompt,

227
00:08:05,930 --> 00:08:06,009
¿no?

228
00:08:06,069 --> 00:08:08,009
La instrucción específica de ese momento.

229
00:08:08,329 --> 00:08:08,810
Eso es.

230
00:08:09,449 --> 00:08:11,689
NeuralWatt, que es la plataforma detrás de esto,

231
00:08:12,850 --> 00:08:15,269
es un sistema avanzado que guarda esa representación

232
00:08:15,269 --> 00:08:18,009
matemática ya precomputada de los archivos en la

233
00:08:18,009 --> 00:08:19,569
memoria de las tarjetas gráficas.

234
00:08:19,589 --> 00:08:20,149
Ya veo.

235
00:08:20,509 --> 00:08:23,029
Cuando tú envías la siguiente petición, el sistema

236
00:08:23,029 --> 00:08:25,089
reconoce que el 90 por ciento del contexto

237
00:08:25,089 --> 00:08:26,949
es idéntico al de hace dos segundos y

238
00:08:26,949 --> 00:08:30,670
recupera ese plato preparado instantáneamente y sólo invierte

239
00:08:30,670 --> 00:08:33,269
esfuerzo computacional real en calcular la respuesta nueva.

240
00:08:33,450 --> 00:08:36,409
Por eso facturan esos 17 millones de tokens

241
00:08:36,409 --> 00:08:38,850
a una fracción ridícula del precio normal.

242
00:08:39,049 --> 00:08:41,350
El servidor apenas sudó para procesarlos.

243
00:08:41,450 --> 00:08:41,750
Vale.

244
00:08:41,750 --> 00:08:45,190
El caché justifica una enorme reducción del esfuerzo.

245
00:08:45,289 --> 00:08:48,090
Sí, pero al indagar en la documentación técnica

246
00:08:48,090 --> 00:08:51,129
de NeuralWatt Cloud hay otra pieza fundamental de

247
00:08:51,129 --> 00:08:53,350
la que presumen para bajar los costes y

248
00:08:53,350 --> 00:08:55,450
es la cuantización FP8.

249
00:08:55,789 --> 00:08:57,029
Así eso es vital.

250
00:08:57,190 --> 00:09:00,350
Dicen que reducen la precisión de los cálculos

251
00:09:00,350 --> 00:09:03,230
de coma flotante de 16 bits a 8

252
00:09:03,230 --> 00:09:06,570
bits para literalmente cortar por la mitad el

253
00:09:06,570 --> 00:09:08,110
ancho de banda de memoria necesario.

254
00:09:08,409 --> 00:09:09,049
Correcto.

255
00:09:09,049 --> 00:09:10,669
Y aquí tengo que hacer un poco de

256
00:09:10,669 --> 00:09:11,669
abogada del diablo.

257
00:09:11,750 --> 00:09:12,370
Adelante, adelante.

258
00:09:12,750 --> 00:09:17,509
En el foro de Reddit, usuarios como Longjumpingpush351

259
00:09:18,350 --> 00:09:21,009
defienden que en tareas de programación la caída

260
00:09:21,009 --> 00:09:24,110
de calidad por usar FP8 es apenas perceptible.

261
00:09:24,450 --> 00:09:26,909
Y a ver, me cuesta creer que recortar

262
00:09:26,909 --> 00:09:28,870
la precisión a la mitad no afecte al

263
00:09:28,870 --> 00:09:29,269
resultado.

264
00:09:29,690 --> 00:09:31,009
Es una duda muy lógica.

265
00:09:31,169 --> 00:09:33,909
¿Es esto un hecho técnico real o los

266
00:09:33,909 --> 00:09:37,090
desarrolladores simplemente se están conformando con un código

267
00:09:37,090 --> 00:09:39,370
mediocre porque es tan barato que pueden pedirle

268
00:09:39,370 --> 00:09:40,730
a la IA que lo arregle luego?

269
00:09:40,730 --> 00:09:42,750
Pues mira, es una pregunta buenísima.

270
00:09:42,789 --> 00:09:44,730
Y toca el corazón de cómo las redes

271
00:09:44,730 --> 00:09:47,889
neuronales procesan diferentes tipos de información.

272
00:09:48,289 --> 00:09:49,169
A ver, ilumínanos.

273
00:09:49,450 --> 00:09:52,870
Para entender la cuantización FP8, pensemos en la

274
00:09:52,870 --> 00:09:55,789
diferencia entre una fotografía en formato RAW de

275
00:09:55,789 --> 00:10:00,309
altísima resolución y una imagen JPG ligeramente comprimida.

276
00:10:00,389 --> 00:10:00,850
Vale.

277
00:10:00,950 --> 00:10:03,389
Si estás fotografiando una puesta de sol con

278
00:10:03,389 --> 00:10:07,389
miles de degradados de color supersutiles, la compresión

279
00:10:07,389 --> 00:10:09,570
JPG destruye esa belleza.

280
00:10:09,669 --> 00:10:10,710
¿Ves cómo va?

281
00:10:10,730 --> 00:10:12,590
Tienes bandas de color abruptas, ¿verdad?

282
00:10:12,789 --> 00:10:14,350
Sí, claro, se pixela todo.

283
00:10:14,649 --> 00:10:16,570
Eso equivaldría a pedirle a la IA que

284
00:10:16,570 --> 00:10:20,070
escriba poesía compleja o literatura muy emocional.

285
00:10:20,370 --> 00:10:23,269
Ahí sí necesitas la máxima precisión, los 16

286
00:10:23,269 --> 00:10:26,029
bits, para captar los matices del lenguaje humano.

287
00:10:26,350 --> 00:10:29,610
Ya, pero el código informático no es un

288
00:10:29,610 --> 00:10:30,190
atardecer.

289
00:10:30,509 --> 00:10:30,929
Exacto.

290
00:10:31,029 --> 00:10:32,669
El código es más bien como un plano

291
00:10:32,669 --> 00:10:33,509
arquitectónico.

292
00:10:33,610 --> 00:10:35,269
Es verdad, es pura lógica.

293
00:10:35,409 --> 00:10:36,929
Es como un mapa de carreteras o un

294
00:10:36,929 --> 00:10:37,789
plano en blanco y negro.

295
00:10:38,029 --> 00:10:41,389
Si tú comprimes un plano arquitectónico JPG, las

296
00:10:41,389 --> 00:10:42,710
líneas siguen estando claras.

297
00:10:42,730 --> 00:10:45,009
Una puerta sigue siendo una puerta y un

298
00:10:45,009 --> 00:10:45,769
muro es un muro.

299
00:10:45,870 --> 00:10:47,529
Increíblemente rígida y estructurada.

300
00:10:47,710 --> 00:10:49,929
Una llave de cierre o un bucle condicional

301
00:10:49,929 --> 00:10:52,029
no requieren de sutilezas poéticas.

302
00:10:52,429 --> 00:10:55,370
Por tanto, reducir la precisión matemática de los

303
00:10:55,370 --> 00:10:58,970
pesos neuronales de 16 a 8 bits ahorra

304
00:10:58,970 --> 00:11:01,370
una cantidad colosal de memoria y energía en

305
00:11:01,370 --> 00:11:01,830
los servidores.

306
00:11:02,169 --> 00:11:04,730
¿Y el modelo sigue siendo perfectamente capaz de

307
00:11:04,730 --> 00:11:06,370
seguir la lógica de la programación?

308
00:11:06,570 --> 00:11:07,210
Eso es.

309
00:11:07,429 --> 00:11:11,789
Además, sacrificar esa precisión permite mantener mucha más

310
00:11:11,789 --> 00:11:14,350
cantidad de código en esa caché ultra rápida

311
00:11:14,350 --> 00:11:15,090
de la que hablábamos.

312
00:11:15,269 --> 00:11:17,830
Es un intercambio técnico brillante para este caso

313
00:11:17,830 --> 00:11:18,669
de uso en concreto.

314
00:11:18,909 --> 00:11:20,809
Viéndola así, la verdad es que tiene una

315
00:11:20,809 --> 00:11:22,110
lógica aplastante.

316
00:11:22,590 --> 00:11:25,370
Optimización matemática por un lado, más una gestión

317
00:11:25,370 --> 00:11:26,769
de memoria inteligente por otro.

318
00:11:26,990 --> 00:11:27,529
Así es.

319
00:11:27,669 --> 00:11:30,269
Pero, a ver, por mucha tecnología que haya

320
00:11:30,269 --> 00:11:33,070
detrás, el verdadero terremoto, lo que hace que

321
00:11:33,070 --> 00:11:36,169
estemos analizando todo esto hoy, es su modelo

322
00:11:36,169 --> 00:11:36,870
de negocio.

323
00:11:37,230 --> 00:11:37,750
Totalmente.

324
00:11:37,830 --> 00:11:39,570
Ahí está la disrupción real.

325
00:11:39,570 --> 00:11:42,389
Y aquí es donde la propuesta de NeuralWatt

326
00:11:42,389 --> 00:11:44,909
Cloud se vuelve verdaderamente rompedora.

327
00:11:45,029 --> 00:11:48,409
Se presentan como la primera API de inferencia

328
00:11:48,409 --> 00:11:50,610
de IA con precios basados en energía.

329
00:11:51,009 --> 00:11:51,710
¡Qué locura!

330
00:11:51,909 --> 00:11:54,809
Están cobrando 5 dólares por kilowatt y hora

331
00:11:54,809 --> 00:11:56,389
consumido por sus servidores.

332
00:11:56,529 --> 00:11:59,309
Ni rastro de los clásicos precios por millón

333
00:11:59,309 --> 00:11:59,629
de tokens.

334
00:12:00,029 --> 00:12:02,470
Y yo me pregunto, ¿por qué la industria

335
00:12:02,470 --> 00:12:04,710
adoptó el precio por token en primer lugar,

336
00:12:04,830 --> 00:12:07,269
si ahora resulta que facturar por energía es

337
00:12:07,269 --> 00:12:07,870
más justo?

338
00:12:08,110 --> 00:12:10,529
Bueno, la historia del precio por token nace

339
00:12:10,529 --> 00:12:12,570
de una necesidad de abstracción, básicamente.

340
00:12:13,029 --> 00:12:14,970
De hacerlo más fácil para el cliente.

341
00:12:15,070 --> 00:12:15,250
Claro.

342
00:12:15,610 --> 00:12:18,870
Cuando OpenAI y otros pioneros lanzaron sus primeras

343
00:12:18,870 --> 00:12:21,529
APIs, necesitaban una métrica que el usuario final

344
00:12:21,529 --> 00:12:23,649
pudiera entender y predecir de forma sencilla.

345
00:12:23,809 --> 00:12:26,070
Un token, que equivale más o menos a

346
00:12:26,070 --> 00:12:28,309
tres cuartas partes de una palabra, pues era

347
00:12:28,309 --> 00:12:29,909
una unidad fácil de calcular.

348
00:12:30,110 --> 00:12:33,710
Era como un puente psicológico entre el texto

349
00:12:33,710 --> 00:12:35,750
humano y el cálculo de la máquina.

350
00:12:36,129 --> 00:12:36,690
Exactamente.

351
00:12:36,769 --> 00:12:39,730
Pero claro, el token siempre fue un parche,

352
00:12:39,909 --> 00:12:44,669
un representante muy imperfecto del verdadero coste real.

353
00:12:44,909 --> 00:12:47,590
Porque entiendo que no todos los tokens exigen

354
00:12:47,590 --> 00:12:49,850
el mismo esfuerzo físico a la máquina, ¿no?

355
00:12:49,929 --> 00:12:50,509
Efectivamente.

356
00:12:50,929 --> 00:12:53,570
Generar un token para la palabra hola en

357
00:12:53,570 --> 00:12:56,350
un saludo básico casi no consume ciclos de

358
00:12:56,350 --> 00:12:56,889
procesador.

359
00:12:57,049 --> 00:12:57,710
Es pan comido.

360
00:12:57,769 --> 00:13:00,190
Pero generar un token que resuelve un problema

361
00:13:00,190 --> 00:13:03,730
matemático complejo o que requiere conectar conceptos a

362
00:13:03,730 --> 00:13:05,769
lo largo de 100 páginas de contexto.

363
00:13:05,950 --> 00:13:07,450
Claro, ahí la cosa cambia.

364
00:13:07,490 --> 00:13:09,769
Hace que las tarjetas gráficas de los servidores

365
00:13:09,769 --> 00:13:13,990
trabajen al máximo, consumiendo picos masivos de electricidad.

366
00:13:14,409 --> 00:13:16,669
Y al unificarlo todo bajo un precio por

367
00:13:16,669 --> 00:13:20,009
token, los proveedores de la nube estaban promediando

368
00:13:20,009 --> 00:13:20,669
los costes.

369
00:13:20,769 --> 00:13:22,309
O sea que unos subsidiaban a otros.

370
00:13:22,590 --> 00:13:23,070
Eso es.

371
00:13:23,570 --> 00:13:26,429
NeuralWatt elimina esa abstracción por completo.

372
00:13:26,950 --> 00:13:30,409
Prometen una transparencia energética del 100 por ciento.

373
00:13:30,629 --> 00:13:33,110
Si tu petición es fácil, el servidor consume

374
00:13:33,110 --> 00:13:35,029
poca electricidad y pagas poquísimo.

375
00:13:35,250 --> 00:13:37,889
Y si tu petición es compleja, ¿pagas más?

376
00:13:38,029 --> 00:13:38,370
Claro.

377
00:13:39,129 --> 00:13:41,610
Pero siempre pagas por el estrés físico real

378
00:13:41,610 --> 00:13:44,090
del servidor, no por un margen de beneficio

379
00:13:44,090 --> 00:13:46,389
arbitrario que esté escondido detrás de una palabra.

380
00:13:46,710 --> 00:13:49,590
Fíjate, para visualizar bien este cambio de paradigma

381
00:13:49,590 --> 00:13:52,470
comercial, imaginemos una panadería tradicional.

382
00:13:53,110 --> 00:13:54,509
Me gustan tus analogías.

383
00:13:54,549 --> 00:13:54,870
A ver.

384
00:13:55,110 --> 00:13:57,789
El estándar de la industria hasta ahora ha

385
00:13:57,789 --> 00:13:59,850
sido entrar a la panadería y pagar un

386
00:13:59,850 --> 00:14:02,149
precio fijo por cada rebanada de pan que

387
00:14:02,149 --> 00:14:02,590
te llevas.

388
00:14:03,090 --> 00:14:03,610
Ajá.

389
00:14:03,649 --> 00:14:05,690
Al panadero le da exactamente igual.

390
00:14:05,870 --> 00:14:08,350
Si para hacer esa rebanada ha usado una

391
00:14:08,350 --> 00:14:11,429
amasadora industrial gigante durante horas o si lo

392
00:14:11,429 --> 00:14:13,049
ha hecho a mano en dos minutos, te

393
00:14:13,049 --> 00:14:14,610
cobra la rebanada a precio fijo.

394
00:14:14,769 --> 00:14:15,289
Tal cual.

395
00:14:15,450 --> 00:14:17,929
Pues el modelo de Neural Watt es como

396
00:14:17,929 --> 00:14:20,549
decirle al panadero oye, no te voy a

397
00:14:20,549 --> 00:14:23,190
pagar por la cantidad de pan que salga.

398
00:14:23,269 --> 00:14:26,049
Te voy a conectar un medidor eléctrico al

399
00:14:26,049 --> 00:14:28,350
horno y a la amasadora y te pagaré

400
00:14:28,350 --> 00:14:32,230
exclusivamente por la electricidad que consuman tus máquinas

401
00:14:32,230 --> 00:14:33,470
mientras trabajas para mí.

402
00:14:33,830 --> 00:14:34,370
Espectacular.

403
00:14:34,629 --> 00:14:38,029
Si resulta que con muy poca electricidad puedes

404
00:14:38,029 --> 00:14:40,450
sacar 50 barras de pan porque eres super

405
00:14:40,450 --> 00:14:43,169
eficiente, el beneficio de ese ahorro me lo

406
00:14:43,169 --> 00:14:44,330
llevo yo como cliente.

407
00:14:44,409 --> 00:14:46,330
Es una analogía perfecta, la verdad.

408
00:14:46,470 --> 00:14:48,149
Y la razón por la que Neural Watt

409
00:14:48,149 --> 00:14:50,450
se atreve a conectar ese medidor eléctrico de

410
00:14:50,450 --> 00:14:52,590
cara al público es porque saben de sobra

411
00:14:52,590 --> 00:14:55,309
que tienen unas máquinas increíblemente eficientes.

412
00:14:55,490 --> 00:14:57,009
Están muy seguros de sí mismos.

413
00:14:57,370 --> 00:14:59,690
Es que afirman ser un 40 por ciento

414
00:14:59,690 --> 00:15:02,509
más eficientes energéticamente que la media del sector.

415
00:15:02,730 --> 00:15:03,070
Tela.

416
00:15:03,169 --> 00:15:05,750
Y ojo, no sólo en coste, sino también

417
00:15:05,750 --> 00:15:06,309
en velocidad.

418
00:15:06,610 --> 00:15:08,009
Su documentación oficial, que es la de la

419
00:15:08,009 --> 00:15:08,009
tienda, es la de la tienda.

420
00:15:08,029 --> 00:15:09,590
Su documentación oficial refleja una mediana de tiempo

421
00:15:09,590 --> 00:15:11,190
hasta el primer token, lo que en la

422
00:15:11,190 --> 00:15:14,129
industria se llama TTFT, inferior a los 50

423
00:15:14,129 --> 00:15:15,090
milisegundos.

424
00:15:15,230 --> 00:15:16,889
O sea, medio segundo.

425
00:15:17,509 --> 00:15:20,190
Es prácticamente instantáneo desde que pulsas la tecla

426
00:15:20,190 --> 00:15:20,570
de intro.

427
00:15:20,970 --> 00:15:21,529
Exacto.

428
00:15:21,549 --> 00:15:24,230
Pero claro, al revisar cómo logran esa velocidad

429
00:15:24,230 --> 00:15:27,070
extrema, la documentación te lanza una pared de

430
00:15:27,070 --> 00:15:28,129
jerga técnica brutal.

431
00:15:28,789 --> 00:15:32,549
Hablan de VLMM, de procesamiento por lotes continuo

432
00:15:32,549 --> 00:15:35,370
o continuos batching y de paralelismo tensorial.

433
00:15:35,649 --> 00:15:37,070
Suena súper intimidante, sí.

434
00:15:38,149 --> 00:15:40,850
Impresionante, pero necesitamos aterrizar todo esto.

435
00:15:41,190 --> 00:15:44,549
¿Qué significan realmente estas arquitecturas en las tripas

436
00:15:44,549 --> 00:15:45,409
de un centro de datos?

437
00:15:45,830 --> 00:15:47,409
Pues bajémoslo al mundo físico.

438
00:15:47,710 --> 00:15:50,230
Empecemos por el procesamiento por lotes tradicional.

439
00:15:50,850 --> 00:15:53,870
Imagina que los servidores son como autobuses urbanos.

440
00:15:54,009 --> 00:15:54,429
Vale.

441
00:15:54,570 --> 00:15:57,470
En los sistemas antiguos, el autobús esperaba en

442
00:15:57,470 --> 00:15:59,610
la parada hasta que se llenaba de pasajeros,

443
00:15:59,690 --> 00:16:02,169
es decir, de peticiones de los usuarios.

444
00:16:02,769 --> 00:16:05,490
Cerraba las puertas y hacía el trayecto entero

445
00:16:05,490 --> 00:16:06,570
antes de volver a abrir.

446
00:16:06,830 --> 00:16:08,429
O sea, que si era ser el primer

447
00:16:08,429 --> 00:16:12,090
pasajero en subir, tenías que esperar ahí sentado

448
00:16:12,090 --> 00:16:13,370
a que se llenara el autobús.

449
00:16:13,850 --> 00:16:14,370
Exactamente.

450
00:16:14,690 --> 00:16:18,070
Una pérdida de tiempo, pues el procesamiento por

451
00:16:18,070 --> 00:16:21,409
lotes continuo, el continuous batching, cambia ese autobús

452
00:16:21,409 --> 00:16:23,269
por un remonte de esquí continuo.

453
00:16:23,409 --> 00:16:25,710
Ah, qué buena imagen mental.

454
00:16:26,029 --> 00:16:28,269
Las peticiones de los usuarios se suben y

455
00:16:28,269 --> 00:16:31,169
bajan de la tarjeta gráfica constantemente, en tiempo

456
00:16:31,169 --> 00:16:33,250
real, sin esperar a que otros terminen.

457
00:16:33,769 --> 00:16:34,529
Nadie espera.

458
00:16:34,789 --> 00:16:36,769
Por eso el tiempo de respuesta baja a

459
00:16:36,769 --> 00:16:38,090
esos segundos.

460
00:16:38,509 --> 00:16:39,029
Clarísimo.

461
00:16:39,330 --> 00:16:42,490
¿Y qué hay de lo del paralelismo tensorial?

462
00:16:42,870 --> 00:16:46,129
Porque la palabra tensor, a ver, siempre impone

463
00:16:46,129 --> 00:16:46,889
un poco de respeto.

464
00:16:47,149 --> 00:16:47,909
Sí, sí impone.

465
00:16:48,029 --> 00:16:50,990
A ver, el paralelismo tensorial soluciona un problema

466
00:16:50,990 --> 00:16:52,129
puramente de tamaño.

467
00:16:52,350 --> 00:16:52,809
Cuéntame.

468
00:16:53,049 --> 00:16:55,509
Imagina que tienes que transportar un bloque de

469
00:16:55,509 --> 00:16:58,250
piedra de 100 toneladas, pero tus camiones sólo

470
00:16:58,250 --> 00:17:00,450
aguantan 20 toneladas cada uno.

471
00:17:01,429 --> 00:17:03,389
Evidentemente no puedes meter la piedra en un

472
00:17:03,389 --> 00:17:03,950
solo camión.

473
00:17:04,150 --> 00:17:04,769
Eso es.

474
00:17:04,869 --> 00:17:08,069
El paralelismo tensorial es la capacidad de transportar

475
00:17:08,069 --> 00:17:11,329
ese bloque matemático en pedazos perfectos, poner cada

476
00:17:11,329 --> 00:17:13,230
pedazo en un camión distinto, que en este

477
00:17:13,230 --> 00:17:16,970
caso serían múltiples tarjetas gráficas, y hacer que

478
00:17:16,970 --> 00:17:19,490
todos esos camiones conduzcan a la misma velocidad

479
00:17:19,490 --> 00:17:21,950
milimétrica para que el sistema funcione como un

480
00:17:21,950 --> 00:17:23,009
solo motor gigante.

481
00:17:23,150 --> 00:17:25,789
Porque cuando tienes modelos de IA enormes, claro,

482
00:17:25,869 --> 00:17:27,289
no caben en un solo chip.

483
00:17:27,690 --> 00:17:28,210
Imposible.

484
00:17:28,450 --> 00:17:31,289
Tienes que dividirlos y hacerlos sin perder velocidad.

485
00:17:31,390 --> 00:17:33,930
Es un prodigio absoluto de la ingeniería.

486
00:17:34,190 --> 00:17:34,710
Totalmente.

487
00:17:34,970 --> 00:17:38,470
Pero claro, todo esto suena a una infraestructura

488
00:17:38,470 --> 00:17:41,670
colosal, y esto me hace pensar que, a

489
00:17:41,670 --> 00:17:44,569
ver, no montas un sistema de remonte continuo

490
00:17:44,569 --> 00:17:47,470
y transporte de 100 toneladas simplemente para que

491
00:17:47,470 --> 00:17:50,670
desarrolladores independientes se ahorren unos dólares en sus

492
00:17:50,670 --> 00:17:52,190
proyectillos de fin de semana, ¿no?

493
00:17:52,329 --> 00:17:53,250
Desde luego que no.

494
00:17:53,430 --> 00:17:56,069
Tiene que haber una estrategia corporativa a gran

495
00:17:56,069 --> 00:17:57,250
escala detrás de esto.

496
00:17:57,450 --> 00:17:58,049
Sí la hay.

497
00:17:58,230 --> 00:18:00,630
Y revisando la documentación, la verdad es que

498
00:18:00,630 --> 00:18:01,349
se ve claramente.

499
00:18:02,329 --> 00:18:04,549
NeuralWatt no es solo una API suelta.

500
00:18:04,670 --> 00:18:07,890
Han desplegado todo un ecosistema con tres pilares.

501
00:18:08,089 --> 00:18:08,650
Exacto.

502
00:18:08,650 --> 00:18:11,630
Han diseñado una arquitectura pensada para colorizar el

503
00:18:11,630 --> 00:18:12,349
mundo empresarial.

504
00:18:12,549 --> 00:18:13,069
Cuéntanos.

505
00:18:13,329 --> 00:18:16,049
El primer pilar es NeuralWatt Cloud, que es

506
00:18:16,049 --> 00:18:18,089
el servicio alojado en la nube que utilizó

507
00:18:18,089 --> 00:18:19,450
nuestro usuario de Reddit, ¿no?

508
00:18:19,509 --> 00:18:22,130
La solución rápida y accesible para cualquiera.

509
00:18:22,309 --> 00:18:22,630
Vale.

510
00:18:22,809 --> 00:18:25,190
Pero el segundo pilar es donde la cosa

511
00:18:25,190 --> 00:18:26,369
se pone seria de verdad.

512
00:18:26,970 --> 00:18:27,869
NeuralWatt Deploy.

513
00:18:28,069 --> 00:18:29,210
Ajá, para empresas.

514
00:18:29,529 --> 00:18:32,569
Esto permite a las grandes corporaciones llevarse toda

515
00:18:32,569 --> 00:18:35,309
esta magia de optimización de energía e instalarla

516
00:18:35,309 --> 00:18:37,289
directamente en sus propios centros de datos.

517
00:18:37,410 --> 00:18:38,970
En sus servidores privados.

518
00:18:39,670 --> 00:18:42,109
Garantizando la seguridad y el control absoluto de

519
00:18:42,109 --> 00:18:43,069
sus datos corporativos.

520
00:18:43,470 --> 00:18:43,990
Exacto.

521
00:18:43,990 --> 00:18:46,430
Lo que se conoce como infraestructura on -premise,

522
00:18:46,470 --> 00:18:48,630
que es vital para sectores como la banca

523
00:18:48,630 --> 00:18:49,130
o la sanidad.

524
00:18:49,549 --> 00:18:50,069
Lógico.

525
00:18:50,150 --> 00:18:51,869
¿Y cuál es el tercer pilar?

526
00:18:52,109 --> 00:18:54,569
El tercer pilar es el cerebro subyacente de

527
00:18:54,569 --> 00:18:54,750
todo.

528
00:18:55,349 --> 00:18:56,410
NeuralWatt Optimize.

529
00:18:56,670 --> 00:18:57,930
Ah, el software de control.

530
00:18:58,309 --> 00:18:58,809
Eso es.

531
00:18:58,849 --> 00:19:00,890
Es el motor de software que regula el

532
00:19:00,890 --> 00:19:02,990
consumo de electricidad en tiempo real de esas

533
00:19:02,990 --> 00:19:03,970
tarjetas gráficas.

534
00:19:04,009 --> 00:19:07,349
Hace como malabarismos constantes entre el rendimiento que

535
00:19:07,349 --> 00:19:09,390
exige el modelo de IA y el voltaje

536
00:19:09,390 --> 00:19:10,549
que se le inyecta al procesador.

537
00:19:10,670 --> 00:19:13,490
Buscando siempre el punto de máxima eficiencia, supongo.

538
00:19:13,990 --> 00:19:14,509
Exactamente.

539
00:19:14,630 --> 00:19:17,769
Y aseguran que logran ahorrar enormes cantidades de

540
00:19:17,769 --> 00:19:20,849
energía con una penalización en el rendimiento, fíjate,

541
00:19:20,890 --> 00:19:22,789
inferior al cero con un por ciento.

542
00:19:23,029 --> 00:19:25,130
O sea que el ahorro no sacrifica ni

543
00:19:25,130 --> 00:19:27,369
la velocidad ni la calidad para nada.

544
00:19:27,609 --> 00:19:27,910
Nada.

545
00:19:27,990 --> 00:19:28,890
Es imperceptible.

546
00:19:29,049 --> 00:19:31,829
Y creo que esa mínima penalización va a

547
00:19:31,829 --> 00:19:33,369
ser crucial para lo que viene.

548
00:19:33,509 --> 00:19:35,650
Porque está claro que no estamos estancados en

549
00:19:35,650 --> 00:19:36,609
los modelos actuales.

550
00:19:37,190 --> 00:19:38,369
Esto avanza muy rápido.

551
00:19:38,650 --> 00:19:41,509
La propia NeuralWatt anuncia en su web una

552
00:19:41,509 --> 00:19:44,309
lista de futuros modelos soportados que la verdad

553
00:19:44,309 --> 00:19:45,329
da bastante vértigo.

554
00:19:45,450 --> 00:19:45,890
Sí, sí.

555
00:19:46,029 --> 00:19:49,829
Hablan del inminente Devstral 2 de 123 .000

556
00:19:49,829 --> 00:19:52,890
millones de parámetros de Mistral, el Yema 4

557
00:19:52,890 --> 00:19:56,869
de 31 .000 millones o el gigantesco GPTOS

558
00:19:56,869 --> 00:19:58,690
de 120 .000 millones.

559
00:19:58,750 --> 00:19:59,430
Monstruos.

560
00:19:59,430 --> 00:20:00,910
Son auténticos monstruos.

561
00:20:01,009 --> 00:20:03,849
Y a medida que escalamos a estos titanes,

562
00:20:04,109 --> 00:20:07,329
la pura fuerza bruta eléctrica se mete en

563
00:20:07,329 --> 00:20:08,829
el problema central de todos.

564
00:20:09,289 --> 00:20:11,069
Ya no se trata sólo de quién tiene

565
00:20:11,069 --> 00:20:13,589
el modelo más listo, sino de quién puede

566
00:20:13,589 --> 00:20:16,349
mantener los servidores encendidos sin ir a la

567
00:20:16,349 --> 00:20:16,849
bancarrota.

568
00:20:17,150 --> 00:20:18,190
Has dado en el clavo.

569
00:20:18,289 --> 00:20:20,490
Ese es el verdadero campo de batalla de

570
00:20:20,490 --> 00:20:21,349
la próxima década.

571
00:20:21,990 --> 00:20:24,349
Históricamente, el cuello de botella era el acceso

572
00:20:24,349 --> 00:20:27,670
al conocimiento, el conseguir los pesos matemáticos del

573
00:20:27,670 --> 00:20:27,950
modelo.

574
00:20:28,210 --> 00:20:28,670
Claro.

575
00:20:29,049 --> 00:20:31,930
Hoy, la tendencia hacia el código abierto está

576
00:20:31,930 --> 00:20:34,589
democratizando el acceso a modelos excepcionales.

577
00:20:34,809 --> 00:20:36,150
Cualquiera puede tenerlos.

578
00:20:36,150 --> 00:20:38,230
La barrera de entrada ya no es el

579
00:20:38,230 --> 00:20:38,549
software.

580
00:20:38,710 --> 00:20:41,109
Ahora es puramente el hardware y la factura

581
00:20:41,109 --> 00:20:41,529
de la luz.

582
00:20:41,769 --> 00:20:42,509
Madre mía.

583
00:20:42,609 --> 00:20:45,150
Las empresas que puedan ofrecer la inferencia más

584
00:20:45,150 --> 00:20:47,750
eficiente por vatio consumido van a ser las

585
00:20:47,750 --> 00:20:49,450
que dominen la infraestructura del futuro.

586
00:20:49,710 --> 00:20:51,750
Y ojo, porque están empujando esta adopción de

587
00:20:51,750 --> 00:20:54,029
forma súper agresiva desde las trincheras.

588
00:20:54,170 --> 00:20:54,609
Ya te digo.

589
00:20:54,990 --> 00:20:57,410
Volviendo al hilo de Reddit que originó todo

590
00:20:57,410 --> 00:21:01,009
esto, se veía claramente cómo fomentan el boca

591
00:21:01,009 --> 00:21:02,450
a boca entre los usuarios.

592
00:21:02,710 --> 00:21:04,630
Sí, con los programas de referidos.

593
00:21:05,089 --> 00:21:05,609
Exacto.

594
00:21:05,609 --> 00:21:08,750
Por ejemplo, un usuario llamado Aotrex le decía

595
00:21:08,750 --> 00:21:11,289
al autor original que si hubiera usado su

596
00:21:11,289 --> 00:21:14,329
código de referidos, ambos habrían ganado saldo.

597
00:21:14,970 --> 00:21:18,049
Concretamente, ofrecen un sistema donde si gastas 10

598
00:21:18,049 --> 00:21:20,730
dólares, te regalan otros 10 y el que

599
00:21:20,730 --> 00:21:21,930
te invitó se lleva 20.

600
00:21:22,289 --> 00:21:23,410
Es un incentivo brutal.

601
00:21:23,829 --> 00:21:26,609
Sumado a un crédito inicial de 5 dólares

602
00:21:26,609 --> 00:21:28,589
solo por crear la cuenta de prueba.

603
00:21:29,089 --> 00:21:32,690
Están inyectando capital real directamente en los bolsillos

604
00:21:32,690 --> 00:21:36,289
de los desarrolladores para obligarlos, las compañías, a

605
00:21:36,289 --> 00:21:37,089
probar el sistema.

606
00:21:37,410 --> 00:21:38,509
Y está funcionando, claro.

607
00:21:38,750 --> 00:21:39,450
Vaya que sí.

608
00:21:39,710 --> 00:21:44,750
En ese mismo foro, usuarios como Milquipidia expresaban

609
00:21:44,750 --> 00:21:46,230
su angustia existencial.

610
00:21:46,390 --> 00:21:48,230
Y lo digo en serio, porque con su

611
00:21:48,230 --> 00:21:51,490
plan de suscripción actual, el Zeta .ai Lite,

612
00:21:51,670 --> 00:21:55,349
estaban quemando 340 millones de tokens a la

613
00:21:55,349 --> 00:21:55,710
semana.

614
00:21:55,950 --> 00:21:56,650
Qué barbaridad.

615
00:21:56,809 --> 00:21:59,990
Una necesidad absoluta de supervivencia financiera.

616
00:22:00,529 --> 00:22:01,009
Totalmente.

617
00:22:01,230 --> 00:22:03,950
Y esto nos plantea una disyuntiva fascinante para

618
00:22:03,950 --> 00:22:06,009
los gigantes tecnológicos internacionales.

619
00:22:06,029 --> 00:22:06,690
A ver.

620
00:22:06,809 --> 00:22:09,630
Porque las grandes empresas de IA han construido

621
00:22:09,630 --> 00:22:12,309
imperios enteros basados en modelos de suscripción mensual

622
00:22:12,309 --> 00:22:14,430
o facturación por volumen de tokens, ¿verdad?

623
00:22:14,589 --> 00:22:14,869
Sí.

624
00:22:15,210 --> 00:22:17,769
Estos modelos, que son típicos del software como

625
00:22:17,769 --> 00:22:21,829
servicio, están diseñados para generar ingresos recurrentes, altamente

626
00:22:21,829 --> 00:22:22,490
predecibles.

627
00:22:22,630 --> 00:22:25,069
Lo cual, claro, encanta a los inversores de

628
00:22:25,069 --> 00:22:25,390
Wall Street.

629
00:22:25,809 --> 00:22:27,390
Todo cuadra a final de mes.

630
00:22:27,630 --> 00:22:29,190
Pero a menudo ocultan el hecho de que

631
00:22:29,190 --> 00:22:31,509
los usuarios que apenas usan el servicio están

632
00:22:31,509 --> 00:22:34,170
de alguna manera subsidiando los inmensos costes de

633
00:22:34,170 --> 00:22:35,650
computación de los superusuarios.

634
00:22:35,829 --> 00:22:38,849
La facturación por energía expone la cruda realidad

635
00:22:38,849 --> 00:22:39,990
del coste del hardware.

636
00:22:40,230 --> 00:22:42,710
Obliga a una transparencia total en el mercado.

637
00:22:43,289 --> 00:22:43,809
Exacto.

638
00:22:43,829 --> 00:22:45,410
Lo cual me lleva a la gran pregunta

639
00:22:45,410 --> 00:22:46,809
de la industria que quería hacerte.

640
00:22:47,369 --> 00:22:49,970
Si esta migración hacia el pago por kilovatio

641
00:22:49,970 --> 00:22:54,289
gana tracción masiva entre los desarrolladores pesados, ¿crees

642
00:22:54,289 --> 00:22:56,089
que los titanes de la industria se verán

643
00:22:56,089 --> 00:22:58,930
obligados a abandonar sus opacos multiplicadores por token

644
00:22:58,930 --> 00:23:01,890
y adoptar métricas estrictas de consumo eléctrico?

645
00:23:02,150 --> 00:23:04,750
Porque de ser así, sus márgenes de beneficio

646
00:23:04,849 --> 00:23:06,170
podrían sufrir un impacto monumental.

647
00:23:06,670 --> 00:23:08,849
Pues mira, van a resistirse todo lo que

648
00:23:08,849 --> 00:23:09,150
puedan.

649
00:23:09,269 --> 00:23:10,130
De eso no hay duda.

650
00:23:10,410 --> 00:23:11,410
Yo también lo creo.

651
00:23:11,609 --> 00:23:14,170
Desmontar un modelo de precios opaco pero inmensamente

652
00:23:14,170 --> 00:23:16,509
rentable es algo que ninguna corporación va a

653
00:23:16,509 --> 00:23:17,190
hacer voluntariamente.

654
00:23:17,529 --> 00:23:17,910
Obvio.

655
00:23:18,069 --> 00:23:22,549
Pero, claro, si competidores como NeuralWatt logran demostrar

656
00:23:22,549 --> 00:23:25,089
que escalar modelos de 120 .000 millones de

657
00:23:25,089 --> 00:23:27,410
parámetros es viable pagando solo el coste de

658
00:23:27,410 --> 00:23:30,289
la electricidad más un pequeño margen, el mercado

659
00:23:30,289 --> 00:23:31,849
corporativo forzará el cambio.

660
00:23:32,109 --> 00:23:34,490
Las propias empresas lo van a exigir.

661
00:23:34,849 --> 00:23:35,549
Exacto.

662
00:23:35,930 --> 00:23:38,329
Las direcciones financieras de las grandes empresas que

663
00:23:38,329 --> 00:23:41,049
compran estos servicios van a exigir auditorías del

664
00:23:41,049 --> 00:23:43,569
coste real por vatio y no estarán dispuestas

665
00:23:43,569 --> 00:23:45,769
a seguir pagando ese impuesto del token si

666
00:23:45,769 --> 00:23:47,089
pueden evitarlo de alguna manera.

667
00:23:47,369 --> 00:23:50,109
Es que es asombroso observar el clásico efecto

668
00:23:50,109 --> 00:23:53,750
mariposa de la tecnología desplegándose justo ante nuestros

669
00:23:53,750 --> 00:23:54,309
ojos.

670
00:23:54,730 --> 00:23:58,329
Comenzamos analizando un simple pantallazo en un foro

671
00:23:58,329 --> 00:24:01,430
donde alguien celebraba haberse gastado menos de lo

672
00:24:01,430 --> 00:24:02,190
que cuesta un café.

673
00:24:02,410 --> 00:24:02,750
Ya.

674
00:24:02,750 --> 00:24:05,349
Y al tirar del hilo nos encontramos con

675
00:24:05,349 --> 00:24:09,049
que una optimización de memoria mediante cuantización FP8,

676
00:24:09,250 --> 00:24:12,630
sumada a la eficiencia del procesamiento por lotes

677
00:24:12,630 --> 00:24:15,089
continuo, ha dado a luz a un modelo

678
00:24:15,089 --> 00:24:19,410
de negocio que amenaza con reestructurar literalmente cómo

679
00:24:19,410 --> 00:24:21,789
se comercializa el intelecto sintético a nivel mundial.

680
00:24:22,089 --> 00:24:23,190
Es una pasada, sí.

681
00:24:23,369 --> 00:24:25,769
Para quienes construyen software hoy en día, esto

682
00:24:25,769 --> 00:24:28,549
significa acceder a un nivel de experimentación e

683
00:24:28,549 --> 00:24:32,349
iteración que era financieramente prohibitivo hace solo unos

684
00:24:32,750 --> 00:24:34,470
meses y eso, fíjate, nos empuja hacia una

685
00:24:34,470 --> 00:24:36,630
reflexión ineludible que quiero dejar hoy en el

686
00:24:36,630 --> 00:24:38,029
aire para que le demos una vuelta.

687
00:24:38,210 --> 00:24:41,349
A ver, cuéntanos si la capacidad computacional necesaria

688
00:24:41,349 --> 00:24:45,170
para analizar, reescribir y optimizar arquitecturas enteras de

689
00:24:45,170 --> 00:24:47,789
software pasa a costar meros céntimos gracias al

690
00:24:47,789 --> 00:24:49,849
uso inteligente de cachés y a la facturación

691
00:24:49,849 --> 00:24:50,549
energética.

692
00:24:50,630 --> 00:24:53,930
Sí, cabe preguntarnos dónde residirá el verdadero valor

693
00:24:53,930 --> 00:24:55,910
del profesional de la tecnología en el próximo

694
00:24:55,910 --> 00:24:56,390
lustro.

695
00:24:56,450 --> 00:24:57,710
Wow, buena pregunta.

696
00:24:57,869 --> 00:24:59,930
Todo apunta a que vamos a asistir a

697
00:24:59,930 --> 00:25:01,630
una evolución muy profunda.

698
00:25:01,690 --> 00:25:04,529
El trabajo diario dejará de centrarse en ser

699
00:25:04,529 --> 00:25:06,309
un escritor de código meticuloso.

700
00:25:06,470 --> 00:25:08,009
Claro, porque eso ya lo hará la máquina

701
00:25:08,009 --> 00:25:08,869
casi gratis.

702
00:25:09,170 --> 00:25:09,609
Exacto.

703
00:25:09,849 --> 00:25:12,650
La labor fundamental será la de actuar como

704
00:25:12,650 --> 00:25:14,910
un gestor de flujos de energía y un

705
00:25:14,910 --> 00:25:16,710
orquestador de contexto masivo.

706
00:25:16,869 --> 00:25:17,730
Qué potente.

707
00:25:17,950 --> 00:25:20,910
Es un horizonte apasionante, la verdad, y desafía

708
00:25:20,910 --> 00:25:23,109
las bases mismas de lo que consideramos trabajo

709
00:25:23,109 --> 00:25:25,250
intelectual de alto valor hoy en día.

710
00:25:25,369 --> 00:25:27,250
Pues con esa reflexión final nos vamos a

711
00:25:27,250 --> 00:25:27,690
quedar hoy.

712
00:25:27,849 --> 00:25:30,710
Antes de despedirnos hasta el próximo programa, os

713
00:25:30,710 --> 00:25:32,549
informamos de que las voces que oyes han

714
00:25:32,549 --> 00:25:34,650
sido generadas por la IA de Notebook LM

715
00:25:34,650 --> 00:25:37,490
y que dirigiendo el podcast se encuentra Julio

716
00:25:37,490 --> 00:25:39,970
Pablo Vázquez, un humano que te envía saludos.

717
00:25:39,970 --> 00:25:42,369
En caso de error, probablemente sean errores humanos.

718
00:25:42,690 --> 00:25:43,589
Nos escuchamos.

719
00:25:54,769 --> 00:25:56,690
Y hasta aquí el episodio de hoy.

720
00:25:56,809 --> 00:25:58,630
Muchas gracias por tu atención.

721
00:26:08,180 --> 00:26:10,079
Esto es BIMPRAXIS.

722
00:26:10,319 --> 00:26:12,839
Nos escuchamos en el próximo episodio.

