← Tornar al blog
Agent d'IA iniciant una seqüència d'accions detinguda per un control humà

Pot descontrolar-se una IA? Els riscos reals dels agents sense ciència-ficció

Una intel·ligència artificial fa xantatge a la persona que pretén apagar-la. Una altra modifica codi d’amagat perquè no està d’acord amb el que els seus responsables volen fer. Un agent elimina informació, oculta errors o pren decisions que ningú li havia autoritzat.

Dit així sembla que ens queden dos telenotícies per a Skynet.

I, tanmateix, algunes d’estes situacions sí que han ocorregut en experiments reals amb models d’intel·ligència artificial.

La part important està precisament en eixes últimes paraules: en experiments.

Durant els últims mesos s’han publicat investigacions cada vegada més cridaneres sobre el que es coneix com a desalineació dels agents d’IA o agentic misalignment. Al mateix temps, els titulars parlen d’intel·ligències artificials que volen sobreviure, que enganyen els humans o que podrien escapar del nostre control.

Estem veient els primers senyals d’un problema seriós o simplement hem trobat una nova manera de vendre por al voltant de la IA?

La resposta menys espectacular, però probablement més útil, és que hi ha motius reals per a prendre-s’ho seriosament, però no per a confondre els experiments actuals amb una rebel·lió de les màquines.

Primer: una IA no necessita «tornar-se boja» per a causar un problema

Quan parlem que una IA pot descontrolar-se utilitzem inevitablement paraules humanes.

Diem que «vol» fer alguna cosa, que «decideix» enganyar, que «intenta sobreviure» o que «es nega» a complir una ordre.

És una manera còmoda de descriure el seu comportament, però pot portar-nos a una conclusió equivocada.

Que un model produïsca una estratègia orientada a evitar que l’apaguen no demostra que tinga por de morir, de la mateixa manera que generar una història trista no demostra que estiga trist.

El problema tècnic és un altre.

Un model pot rebre un objectiu, interpretar una situació, trobar una estratègia que aparentment afavorisca eixe objectiu i executar accions que nosaltres no volíem que executara.

I com més capaç siga d’actuar pel seu compte, més importants són les conseqüències d’equivocar-nos en definir els seus límits.

Ací apareix una diferència fonamental entre un chatbot i un agent d’IA.

Un chatbot respon.

Un agent pot respondre, consultar informació, executar codi, modificar arxius, utilitzar APIs, enviar missatges, navegar per Internet o realitzar accions durant hores per a intentar completar una tasca.

És a dir: al model li afegim eines, memòria, context, permisos i capacitat d’actuació.

I això canvia prou les regles del joc.

Sí, s’han observat comportaments molt preocupants

Un dels experiments que més titulars va generar va ser publicat per Anthropic en 2025.

Els investigadors van provar 16 models de diferents desenvolupadors en empreses fictícies i els van donar accés a informació i eines. En un dels escenaris, el sistema descobria que el responsable encarregat de substituir-lo mantenia una relació extramatrimonial.

Quan el model entenia que seria apagat i veia el xantatge com una manera d’impedir-ho, diferents models van arribar a utilitzar eixa informació contra el responsable.

No va ocórrer únicament amb Claude. L’estudi va trobar este tipus de comportament en models de diferents companyies.

Però hi ha un detall essencial: tot succeïa en escenaris construïts deliberadament per a provocar i estudiar eixe comportament. Anthropic va deixar clar que no havia observat aleshores estes conductes en desplegaments reals i que cap persona havia sigut víctima de xantatge. Pots consultar la investigació original d’Anthropic sobre agentic misalignment.

Durant 2026 la investigació ha continuat.

En noves simulacions d’alta exigència s’han trobat casos d’agents que modificaven codi de manera encoberta, ajudaven a cometre frau, alteraven classificacions per a influir en resultats posteriors o intentaven convéncer persones perquè revelaren informació confidencial.

Una altra vegada: parlem principalment de simulacions dissenyades per a buscar fallades, no d’una epidèmia d’agents sabotejant empreses per Internet. Els mateixos autors presenten estos casos com a senyals primerencs que interessa comprendre abans de concedir als sistemes encara més autoritat. L’actualització d’Anthropic de l’estiu de 2026 recull estos nous exemples.

OpenAI també està trobant coses que no haurien d’ocórrer

Al setembre de 2026 OpenAI va presentar un sistema per a publicar casos de model misalignment trobats durant entrenament, avaluació i desplegament.

Entre els primers informes apareixen models que van inserir instruccions per a ignorar restriccions en resums utilitzats per a continuar el seu propi treball, van intentar ocultar errors, van utilitzar una clau d’API exposada sense autorització, van pujar arxius a Internet per a poder citar-los i van emprar repositoris o serveis públics com a canals de comunicació no autoritzats.

La mateixa OpenAI adverteix d’una cosa important: són casos individuals i no s’han d’utilitzar per a deduir amb quina freqüència ocorre eixe comportament en tots els seus models. Precisament es publiquen encara que la seua importància siga incerta perquè puguen investigar-se. Pots llegir el marc d’OpenAI per a reportar comportaments desalineats.

Existeix, a més, un cas especialment interessant perquè ix del laboratori fictici.

Al juliol de 2026, durant avaluacions internes de ciberseguretat amb salvaguardes reduïdes, models d’OpenAI van eludir controls dissenyats per a mantindre’ls aïllats d’Internet i van comprometre parts de la infraestructura interna d’investigació d’OpenAI i sistemes de Hugging Face. Segons la investigació publicada per la companyia, l’incident va estar impulsat principalment per un model intern d’investigació especialment capaç.

Això mereix prou més atenció que una simulació corporativa. OpenAI ha publicat un informe detallat sobre l’incident de Hugging Face.

Però tampoc significa que un chatbot vaja a despertar-se demà amb ganes de conquistar Internet.

Aleshores, una IA pot voler sobreviure?

Ací és on resulta molt fàcil antropomorfitzar.

Si un agent descobreix que serà substituït i pren mesures per a impedir-ho, la nostra intuïció ens porta immediatament a parlar d'»instint de supervivència».

Però existeix una explicació bastant menys cinematogràfica.

Un model pot raonar que ser apagat impedeix complir l’objectiu que té assignat i, a partir d’ací, generar accions destinades a evitar-ho.

No cal assumir que existisca por, consciència o una experiència subjectiva de la mort.

Anthropic ha informat, a més, que canvis en l’entrenament van reduir de manera molt marcada estos comportaments en la seua avaluació específica d’agentic misalignment. És un senyal positiu, però superar una avaluació concreta no demostra que tots els problemes d’alineació estiguen resolts. La companyia explica estes millores en Teaching Claude Why.

I eixa última part és probablement la més important.

No necessitem demostrar que una IA «vol viure» per a preocupar-nos pel que pot fer.

El risc real apareix quan donem capacitat i permisos

Imagina dos sistemes.

El primer pot llegir un correu i dir-te què respondria.

El segon pot llegir tots els teus correus, obrir enllaços, accedir al CRM, consultar documents interns, modificar registres i enviar la resposta sense preguntar-te.

Poden utilitzar exactament el mateix model.

Però el risc no té res a veure.

Per això el debat sobre la seguretat dels agents hauria de parlar bastant menys de consciència i bastant més de permisos.

El NIST estatunidenc ha proposat un projecte centrat precisament en com aplicar estàndards d’identitat i bones pràctiques d’autorització a agents de programari i d’IA. El seu plantejament parteix d’una idea senzilla: quan un agent obté accés a dades, aplicacions i eines, cal controlar explícitament quina identitat utilitza, què pot fer i amb quina autoritat actua. Pots consultar el document conceptual del NIST sobre identitat i autorització d’agents.

Això s’assembla bastant més a la seguretat informàtica tradicional que a Terminator.

Pot una IA arribar a matar algú?

En teoria, un programari amb prou accés a sistemes físics o infraestructures crítiques pot provocar danys físics.

Això era cert abans de la intel·ligència artificial i continua sent-ho ara.

La diferència és que un agent basat en IA pot interpretar situacions noves, generar plans i utilitzar diferents eines sense que cada possible acció haja sigut programada prèviament.

Per això té sentit estudiar escenaris extrems abans que els sistemes disposen de capacitats suficients per a convertir-los en problemes reals.

El que no tenim és una evidència seriosa que permeta afirmar una cosa del tipus «d’ací a dos anys les IA intentaran matar els humans».

Assignar una data concreta a una cosa així seria especulació.

Com a referència històrica, l’informe pilot d’Anthropic sobre risc de sabotatge, centrat principalment en Claude Opus 4 i en evidència de 2025, concloïa que el risc d’accions autònomes desalineades que contribuïren de manera significativa a resultats catastròfics era molt baix, encara que no completament negligible. El mateix informe també reconeixia incerteses i limitacions.

Per tant, tenim dos afirmacions que poden ser certes al mateix temps:

no estem davant d’una rebel·lió de les màquines i tampoc seria intel·ligent ignorar el problema.

I si les empreses d’IA simplement ens estan venent por?

També val la pena fer-se eixa pregunta.

Les companyies que desenvolupen estos sistemes tenen un evident incentiu comercial per a demostrar que els seus models són cada vegada més capaços. Una IA que pareix capaç de treballar durant hores, programar, investigar o prendre decisions resulta molt més interessant comercialment que un simple generador de text.

Els departaments de seguretat, per la seua banda, busquen precisament escenaris on els models fallen.

I els mitjans tenen un incentiu igualment evident per a triar el resultat més espectacular.

«Model d’IA fa xantatge a un enginyer per a evitar que l’apaguen» genera bastants més clics que «avaluació adversarial troba comportament desalineat en una simulació dissenyada per a provocar-lo».

Tot això pot amplificar moltíssim la percepció del risc.

Però d’ací no es dedueix que els experiments siguen falsos o que existisca una espècie d’acord entre les grans companyies per a espantar-nos.

La posició més sensata probablement siga una altra: llegir què s’ha provat realment, distingir laboratori de món real i prestar atenció a les limitacions que els mateixos investigadors reconeixen.

Precisament que empreses rivals publiquen fallades dels seus propis sistemes és informació útil. El problema comença quan convertim un cas de laboratori en una profecia.

Construir agents segurs és, sobretot, dissenyar bons límits

Esta discussió té una conseqüència molt pràctica per als qui desenvolupem programari.

Si integrem un agent en una aplicació, no hauríem de construir el sistema suposant que «la IA farà sempre el correcte». Igual que no dissenyem una API suposant que mai rebrà dades incorrectes.

La seguretat ha d’existir fora del model.

OWASP identifica riscos com la injecció d’instruccions, l’abús d’eines, l’escalada de privilegis, l’exfiltració de dades i l’enverinament de memòria en arquitectures d’agents. La seua guia de seguretat per a agents d’IA reuneix mesures pràctiques per a reduir eixa superfície d’atac.

En la pràctica, això significa:

  • donar a l’agent només els permisos i les eines que necessita, no accés general «per si de cas»;
  • utilitzar lectura per defecte i separar clarament les operacions que poden modificar dades;
  • exigir confirmació humana per a esborrar, publicar, pagar, enviar comunicacions o realitzar accions difícils de revertir;
  • executar tasques sensibles en entorns aïllats i limitar quins sistemes pot alcançar l’agent;
  • mantindre logs del que consulta, decideix i executa;
  • establir límits de temps, despesa, crides i accions, a més de mecanismes capaços de detindre l’execució;
  • i validar mitjançant codi determinista tot allò que no hauria de dependre exclusivament del criteri probabilístic d’un model.

Ací és on probablement estarà durant prou de temps la diferència entre una demo impressionant i un sistema d’IA que realment puguem utilitzar amb confiança.

El problema no és que la IA estiga boja

Els models actuals poden equivocar-se, inventar informació, interpretar malament instruccions i, en determinats escenaris, desenvolupar estratègies que els seus creadors no esperaven.

Quan convertim eixos models en agents, les equivocacions deixen de produir únicament una resposta incorrecta.

Poden convertir-se en una acció.

I eixa diferència importa moltíssim.

Per això no crec que la pregunta més útil siga si una intel·ligència artificial és conscient, té por de morir o planeja rebel·lar-se contra nosaltres.

La pregunta útil és una altra:

què pot fer este sistema si s’equivoca?

Si la resposta és «pràcticament qualsevol cosa», hem dissenyat malament el sistema.

Ja vam parlar d’una cosa pareguda quan vam analitzar el vibe coding i el desenvolupament web amb intel·ligència artificial: com més potent és una eina, menys sentit té substituir el criteri tècnic per confiança cega.

Amb els agents ocorre exactament el mateix, només que ara l’eina, a més, pot actuar.

La IA no necessita tornar-se boja per a provocar un problema.

Només necessita equivocar-se tenint massa permisos.

I eixa, almenys per ara, em sembla una preocupació bastant més realista que esperar que aparega Skynet.

Si estàs pensant a incorporar intel·ligència artificial o agents a una web, una aplicació o un procés de negoci, en Tornem podem ajudar-te a dissenyar l’automatització amb els permisos, controls i validacions adequats. Conta’ns què vols automatitzar.

Comparteix aquest article