La soberanía de la IA es más que dónde se ejecuta el modelo
El debate sobre la soberanía de la IA se presenta cada vez más como una elección binaria.
Ejecutar IA en la nube, donde están disponibles los modelos más capaces y enormes cantidades de cómputo.
O ejecutar IA localmente, donde el usuario controla la máquina, los datos y el entorno de ejecución.
Ambos enfoques tienen ventajas reales.
Antes de elegir cualquiera de los dos, hay una pregunta más básica que vale la pena hacerse:
¿Qué problema estoy tratando realmente de resolver?
¿Esta tarea realmente requiere inteligencia de frontera?
¿Podría un modelo local más pequeño resolverla suficientemente bien?
¿Debería confiarle mi información sensible a una parte externa?
¿La tarea se ejecutará una vez, o miles de veces?
Esas preguntas importan porque el modelo más poderoso no es automáticamente el modelo correcto.
Y puede que la pregunta más importante no sea, en última instancia, dónde se ejecuta la inteligencia.
Puede ser:
¿Quién controla el sistema que decide dónde se ejecuta la inteligencia, qué información recibe y qué autoridad se le concede?
El caso de la IA en la nube
La IA en la nube se volvió dominante por buenas razones.
Los proveedores más grandes pueden ofrecer capacidades que son difíciles de reproducir localmente para individuos u organizaciones:
- acceso a modelos de frontera;
- recursos computacionales masivos;
- sistemas actualizados continuamente;
- ventanas de contexto amplias;
- agentes persistentes;
- gestión mínima de infraestructura.
Para la mayoría de los usuarios, la experiencia es simple.
Pedir inteligencia y recibirla.
La complejidad permanece en otro lugar.
Eso se vuelve aún más atractivo a medida que la IA evoluciona de responder preguntas hacia realizar trabajos de mayor duración.
Pero la conveniencia introduce dependencia.
Con el tiempo, el mismo proveedor puede llegar a contener cada vez más no solo el modelo, sino también los archivos, la memoria y el historial del usuario.
En ese punto, el usuario ya no está simplemente alquilando acceso a un modelo.
Puede estar entregando una porción cada vez mayor de su entorno de inteligencia.
También existe una incertidumbre económica que es fácil pasar por alto.
La industria de la IA todavía está invirtiendo cantidades extraordinarias de capital en infraestructura, adquisición de clientes y posición de mercado. Las suscripciones y los precios de inferencia de hoy no deberían asumirse automáticamente como una representación de la economía a largo plazo de agentes persistentes que consumen grandes cantidades de cómputo.
La inteligencia en la nube puede seguir abaratándose.
O los agentes cada vez más capaces pueden simplemente consumir más de ella.
De cualquier manera, cualquiera que esté construyendo una dependencia a largo plazo debería entender que el modelo de precios de hoy no necesariamente será el de mañana.
El caso de la IA local
La IA local ofrece una propuesta muy diferente.
El modelo se ejecuta en hardware que el usuario controla.
La información sensible puede permanecer en el dispositivo. Puede que no haya un medidor de uso por cada token generado. Las aplicaciones pueden seguir operando sin depender de la disponibilidad o las políticas de un proveedor externo de inferencia.
A medida que los modelos de pesos abiertos mejoran y el hardware local se vuelve más capaz, esta opción se vuelve cada vez más práctica.
La IA local puede ofrecer:
- mayor privacidad;
- control directo sobre la ejecución;
- menor dependencia de proveedores individuales de IA;
- acceso continuo cuando cambian los servicios externos.
Para individuos y organizaciones que valoran el control, esas ventajas son sustanciales.
Pero la IA local no es gratis.
El hardware capaz puede costar miles de dólares. Se deprecia, consume energía, requiere mantenimiento y aun así puede ser incapaz de reproducir las capacidades de frontera más exigentes computacionalmente.
También hay un punto más sutil.
Ejecutar un modelo localmente no significa necesariamente que el modelo en sí sea abierto.
La frase "modelo abierto" se usa con frecuencia de manera imprecisa. Los pesos descargables no necesariamente brindan acceso a los datos de entrenamiento, la metodología de entrenamiento, la pila completa de software o derechos comerciales sin restricciones.
Los términos de licencia también importan.
Una empresa puede integrar profundamente un modelo de pesos abiertos en sus sistemas solo para descubrir después que sus derechos comerciales, umbrales de ingresos, términos de redistribución o acceso futuro no funcionan como originalmente asumió.
Para entonces, reemplazar el modelo puede ser costoso.
Un modelo puede ejecutarse completamente en hardware propio y aun así crear una forma de dependencia de proveedor.
Eso significa que la ejecución local resuelve un problema importante de soberanía.
No resuelve todos los problemas de soberanía.
Haz primero la pregunta más pequeña
La discusión local-versus-nube puede convertirse fácilmente en otro debate tecnológico en busca de un problema.
Un mejor punto de partida es la tarea en sí.
Supongamos que un modelo local pequeño puede:
- clasificar documentos;
- resumir notas privadas;
- redactar texto rutinario;
- extraer información estructurada;
- realizar asistencia común de programación;
- manejar flujos de trabajo personales recurrentes.
¿Esas tareas necesitan el modelo de frontera más capaz disponible?
Tal vez no.
En el otro extremo, un problema de investigación difícil, una pregunta compleja de ingeniería o un análisis de alto impacto puede justificar el uso de inteligencia externa significativamente más capaz.
La disciplina importante es resistir la suposición de que tener acceso al modelo más fuerte significa que toda tarea debería usarlo.
La inteligencia correcta es la capacidad menos compleja que resuelve el problema suficientemente bien bajo las restricciones requeridas.
Esa es una decisión de ingeniería antes de ser una decisión de IA.
La falsa opción binaria
Es poco probable que el futuro sea completamente local o completamente en la nube.
La mayoría de las personas probablemente terminará usando ambos.
El trabajo rutinario podría ocurrir localmente.
La información sensible debería permanecer dentro de entornos controlados.
El razonamiento complejo podría usar temporalmente un modelo de frontera.
Las tareas de larga duración podrían moverse a infraestructura persistente en la nube.
Los modelos especializados pueden usarse para formas particulares de análisis.
El verdadero desafío se vuelve entonces la orquestación.
¿Qué inteligencia debería encargarse de qué tarea?
Esa pregunta suena técnica, pero rápidamente se vuelve arquitectónica.
Una capa útil de orquestación debe considerar más que la calidad del modelo.
Puede necesitar evaluar:
- capacidad;
- privacidad;
- licenciamiento;
- costo;
- latencia;
- requisitos de contexto;
- confiabilidad;
- persistencia;
- acceso a herramientas;
- política;
- riesgo.
Elegir el modelo más capaz no siempre es lo mismo que tomar la mejor decisión de ejecución.
Tres capas de soberanía
Esto sugiere que la soberanía de la IA puede tener capas distintas.
Soberanía de ejecución
¿Dónde ocurre el cómputo?
La ejecución local ofrece una de las formas más fuertes de control directo. El usuario posee o controla el hardware que realiza la inferencia.
Pero la ubicación de la ejecución es solo una pregunta.
Soberanía de contexto
¿Qué se le permite saber a cada proveedor de inteligencia?
Un sistema no debería enviar automáticamente todo su historial, memoria o datos privados a cada modelo capaz de ayudar con una tarea.
Un proveedor puede requerir solo un pequeño subconjunto de contexto.
Otra tarea puede necesitar permanecer completamente local.
Una tercera puede permitir que un modelo externo reciba un resumen cuidadosamente construido mientras los registros subyacentes permanecen privados.
La pregunta importante deja de ser solamente:
¿Qué modelo debería ejecutarse?
y pasa a ser:
¿Qué se le permite saber a ese modelo?
Soberanía de autoridad
¿Qué se le permite hacer a la inteligencia?
La capacidad de razonar no debería convertirse automáticamente en autoridad.
Se puede permitir que un modelo analice información sin permitirle modificar nada.
Otra capacidad puede proponer una acción pero requerir aprobación antes de ejecutarla.
Algunas tareas de bajo riesgo pueden manejarse automáticamente.
Las decisiones de impacto deberían permanecer sujetas a autoridad humana explícita.
Cuanto más capaz se vuelve la IA, más importantes se vuelven estas distinciones.
La capa intermedia que falta
Los modelos locales y los sistemas de frontera en la nube están mejorando rápidamente.
Lo que sigue siendo menos maduro es la capa entre ellos.
Alguien —o algo— debe determinar:
- qué capacidad debería usarse;
- dónde debería ejecutarse;
- qué contexto debería recibir;
- qué políticas aplican;
- cuándo se requiere autoridad adicional.
A veces, la decisión correcta de enrutamiento no consiste solo en elegir un modelo diferente, sino en reducir lo que ese modelo puede ver.
Esa capa puede terminar siendo más importante que cualquier modelo individual.
Los modelos seguirán cambiando.
Los proveedores cambiarán.
El hardware mejorará.
Surgirán nuevas formas de ejecución confidencial y descentralizada.
Si cada cambio exige abandonar la memoria, el contexto, los flujos de trabajo y el entendimiento acumulado del usuario, entonces la soberanía sigue siendo frágil independientemente de dónde ocurra la inferencia.
Una arquitectura más duradera permitiría que la ejecución cambie mientras la relación de inteligencia permanece continua.
Ser dueño de la relación de inteligencia
Esto conduce a una interpretación distinta de la IA soberana.
Poseer un modelo local poderoso es una forma de soberanía.
Pero otra forma puede ser más duradera:
ser dueño de la arquitectura que decide cómo se usa la inteligencia.
Un sistema así podría usar modelos locales cuando la privacidad, el costo o la independencia favorezcan la ejecución local.
Podría usar modelos de frontera cuando una mayor capacidad justifique la dependencia adicional.
Podría adoptar futuros sistemas confidenciales, descentralizados o especializados sin reconstruir desde cero la relación del usuario con la IA.
Las capas importantes permanecerían bajo el control del usuario:
- identidad;
- continuidad;
- contexto;
- gobernanza;
- autoridad.
Los modelos aportarían inteligencia.
No serían dueños de la relación.
Esta es una de las direcciones arquitectónicas que se están explorando en Aion: tratar a los proveedores de razonamiento como capacidades reemplazables debajo de una capa de continuidad y gobernanza, en lugar de convertir a cualquier modelo individual en el centro del sistema.
Más allá de local versus nube
La industria de la IA puede pasar los próximos años debatiendo cuánta inteligencia debería moverse al hardware personal y cuánta debería permanecer en enormes centros de datos.
Probablemente ambos lados tendrán parte de razón.
Los modelos locales se volverán dramáticamente más útiles.
Los sistemas de frontera seguirán ofreciendo capacidades que son difíciles o antieconómicas de reproducir en una máquina personal.
Por lo tanto, el futuro más interesante puede ser híbrido.
Pero un futuro híbrido crea una nueva pregunta.
¿Quién controla el enrutamiento?
Si la respuesta siempre es el proveedor del modelo, muy poco ha cambiado.
Si el usuario —o una arquitectura que actúa bajo la autoridad del usuario— controla cómo se combinan los modelos, el contexto y la ejecución, la soberanía empieza a existir por encima del modelo mismo.
Puede que la pregunta no sea si somos dueños de cada modelo que usamos.
Pocos individuos u organizaciones llegarán alguna vez a poseer los modelos más capaces del mundo.
La pregunta más importante es si podemos cambiar modelos y entornos de ejecución sin entregar nuestra memoria, contexto, autoridad o continuidad.
El futuro de la IA soberana puede, por lo tanto, no ser ni local ni nube.
Puede ser una arquitectura capaz de usar ambas sin pertenecer a ninguna.