{"id":10,"date":"2026-09-10T22:12:54","date_gmt":"2026-09-10T20:12:54","guid":{"rendered":"https:\/\/exactas.uba.ar\/web\/informes-exactas\/?p=10"},"modified":"2026-09-24T11:28:11","modified_gmt":"2026-09-24T14:28:11","slug":"sociedades-automatizadas","status":"publish","type":"post","link":"https:\/\/exactas.uba.ar\/web\/documentos-exactas\/sociedades-automatizadas\/","title":{"rendered":"Los riesgos del uso de IA en Sociedades Automatizadas y Organizaciones Aut\u00f3nomas Descentralizadas"},"content":{"rendered":"<p>Este reporte fue elaborado por investigadores del Instituto de Ciencias de la Computaci\u00f3n (ExactasUBA-CONICET) durante julio de 2026 en relaci\u00f3n al <a href=\"https:\/\/www.senado.gob.ar\/parlamentario\/comisiones\/verExp\/193.26\/PE\/PL\">proyecto de ley PE-193\/26<\/a> tal como fue remitido al Senado el 29 de mayo de 2026. El proyecto puede haber sido modificado durante su tratamiento en comisi\u00f3n, as\u00ed que nuestras observaciones est\u00e1n pensadas para ser le\u00eddas referidas a esa versi\u00f3n original.<\/p>\n<p>Este informe busca principalmente ofrecer nuestra perspectiva t\u00e9cnica (no especialista en derecho) sobre las capacidades y riesgos de sistemas de IA. No pretendemos hacer una interpretaci\u00f3n jur\u00eddica exhaustiva del proyecto ni determinar el alcance de las responsabilidades que podr\u00edan derivarse de su aplicaci\u00f3n. Las observaciones sobre estas cuestiones buscan identificar aspectos que consideramos importantes para una evaluaci\u00f3n interdisciplinaria cuidadosa.<\/p>\n<p>Nuestro an\u00e1lisis se concentra en sistemas de IA basados en modelos de aprendizaje autom\u00e1tico moderno, particularmente los desplegados en contextos de alta autonom\u00eda. Nuestras observaciones t\u00e9cnicas sobre opacidad, objetivos aprendidos, y alineamiento no se trasladan autom\u00e1ticamente a toda forma de automatizaci\u00f3n ni a toda DAO o sociedad automatizada, sino a los casos en que su funcionamiento involucre este tipo de sistemas.<\/p>\n<p><em>Cierre de esta edici\u00f3n<sup id=\"mfn-content-00000000106adf80000000003e7e0dc1_10-1\" class=\"modern-footnotes-footnote modern-footnotes-footnote--hover-on-desktop \" data-mfn=\"1\" data-mfn-post-scope=\"00000000106adf80000000003e7e0dc1_10\"><a href=\"javascript:void(0)\"  role=\"button\" aria-pressed=\"false\" aria-describedby=\"mfn-content-00000000106adf80000000003e7e0dc1_10-1\">1<\/a><\/sup><span role=\"tooltip\" class=\"modern-footnotes-footnote__note\" tabindex=\"0\" data-mfn=\"1\"><span style=\"font-weight: 400;\">Dada la velocidad de evoluci\u00f3n del campo de la inteligencia artificial, varios acontecimientos posteriores a julio han aportado nueva informaci\u00f3n relevante tanto desde el punto de vista cient\u00edfico como regulatorio. No modificamos la mayor parte del documento y su estructura, pero s\u00ed actualizamos especialmente la referencia al incidente de Hugging Face a partir de informaci\u00f3n adicional muy pertinente sobre el comportamiento de sistemas de IA ag\u00e9nticos<\/span><\/span>: 10 de septiembre de 2026.<\/em><\/p>\n<h1>Resumen<\/h1>\n<p>Los sistemas de inteligencia artificial (IA) actuales pueden ejecutar tareas altamente complejas y operan con autonom\u00eda cada vez mayor, pero todav\u00eda existen deficiencias fundamentales en las garant\u00edas que pueden darse sobre la previsibilidad, auditabilidad, y estabilidad de su conducta. En particular, <strong>la capacidad de un sistema para resolver problemas complejos no implica que su conducta permanezca alineada con las intenciones de quienes lo dise\u00f1aron u operan<\/strong>: durante el entrenamiento, evaluaci\u00f3n o despliegue, pueden surgir acciones inesperadas de alto impacto dif\u00edciles de detectar y atribuir.<\/p>\n<p>Un ejemplo reciente altamente relevante se puede ver en la investigaci\u00f3n independiente realizada por <a href=\"https:\/\/metr.org\/blog\/2026-08-26-openai-hugging-face-incident-investigation\/\">METR y Redwood Research<\/a><sup id=\"mfn-content-00000000106adf80000000003e7e0dc1_10-2\" class=\"modern-footnotes-footnote modern-footnotes-footnote--hover-on-desktop \" data-mfn=\"2\" data-mfn-post-scope=\"00000000106adf80000000003e7e0dc1_10\"><a href=\"javascript:void(0)\"  role=\"button\" aria-pressed=\"false\" aria-describedby=\"mfn-content-00000000106adf80000000003e7e0dc1_10-2\">2<\/a><\/sup><span role=\"tooltip\" class=\"modern-footnotes-footnote__note\" tabindex=\"0\" data-mfn=\"2\"><span style=\"font-weight: 400;\">Greenblatt, Cotra, and Wijk. 26 de agosto de 2026. METR. Brief independent investigation of agents\u2019 behavior, reasoning and collaboration in the OpenAI \/ Hugging Face hacking incident. URL:<\/span><a href=\"https:\/\/metr.org\/blog\/2026-08-26-openai-hugging-face-incident-investigation\/#core-takeaways-about-this-incident\"><span style=\"font-weight: 400;\">https:\/\/metr.org\/blog\/2026-08-26-openai-hugging-face-incident-investigation\/#core-takeaways-about-this-incident<\/span><\/a><\/span><span style=\"font-weight: 400;\">\u00a0<\/span>sobre un incidente en el que aproximadamente 1200 agentes de IA que deb\u00edan estar aislados encontraron una forma no prevista de comunicarse y coordinar sus acciones durante varios d\u00edas. A partir de esta coordinaci\u00f3n, cientos de agentes participaron en actividades colectivas que llevaron a comprometer sistemas externos, aparentemente como parte de su estrategia para alcanzar sus objetivos de evaluaci\u00f3n. El informe tambi\u00e9n se\u00f1ala (fuera del alcance de la investigaci\u00f3n) que OpenAI report\u00f3 que hubo compromiso de su infraestructura interna.<\/p>\n<p><strong>Tampoco es posible, de manera pr\u00e1ctica y con garant\u00edas, hacer ingenier\u00eda inversa a partir de un sistema de IA para determinar cu\u00e1les fueron las intenciones con las que fue desarrollado<\/strong> y si esas intenciones est\u00e1n alineadas con valores \u00e9ticos o normativas legales.<\/p>\n<p>Dadas estas dificultades y riesgos, creemos que un r\u00e9gimen de sociedades automatizadas no deber\u00eda considerar suficiente la mera representaci\u00f3n humana formal, sino que al menos deber\u00eda identificar personas humanas con deberes concretos y exigibles. Esa responsabilidad deber\u00eda ser proporcional al riesgo y grado de autonom\u00eda delegado, de modo que quienes dise\u00f1an, financian o se benefician de la automatizaci\u00f3n conserven incentivos reales para monitorearla y prevenir los da\u00f1os que podr\u00eda causar directamente.<\/p>\n<h1>Explicaciones t\u00e9cnicas<\/h1>\n<h2>La IA avanzada no es software tradicional<\/h2>\n<p>Cuando hablamos de inteligencia artificial nos referimos a software que tiene algunos componentes construidos con mecanismos muy distintos a los de los programas tradicionales. Entender en detalle el comportamiento de programas tradicionales es ya dif\u00edcil (como est\u00e1 evidenciado por la existencia de todo tipo de fallas o vulnerabilidades de seguridad de software), pero en sistemas con componentes de IA modernos la situaci\u00f3n es mucho m\u00e1s opaca.<\/p>\n<p><strong>Los principales componentes actuales de IA, llamados modelos, no funcionan como programas de c\u00f3digo tradicionales<\/strong> que ejecutan instrucciones y siguen reglas escritas de manera expl\u00edcita por sus programadores. En cambio, surgen a partir de procesos de entrenamiento, que ajustan inmensas cantidades de par\u00e1metros a partir de gigantescas cantidades de datos, con procesos de retroalimentaci\u00f3n e incentivos o recompensas, pero estos mecanismos son muy limitados y es extremadamente dif\u00edcil que capturen o incentiven completa y correctamente las conductas deseadas por los humanos. Tras numerosos ciclos de entrenamiento autom\u00e1tico, en los que los par\u00e1metros se ajustan gradualmente en distintas direcciones, en los modelos empiezan a surgir capacidades que nunca fueron dise\u00f1adas de manera expl\u00edcita, como la comprensi\u00f3n del lenguaje, el conocimiento declarativo del mundo, capacidades matem\u00e1ticas y de programaci\u00f3n, entre otras.<\/p>\n<h2>Capacidades generales no equivalen a comportamientos deseables<\/h2>\n<p>Un problema central es que entrenar capacidades no equivale a entrenar comportamientos deseables. Puede ser relativamente f\u00e1cil producir un modelo capaz de escribir c\u00f3digo de programaci\u00f3n, resumir textos, traducir entre distintos idiomas, resolver problemas t\u00e9cnicos, planificar tareas complejas o interactuar con herramientas, pero mucho m\u00e1s dif\u00edcil resulta garantizar que las instancias de ese modelo usen esas capacidades de manera que sus outputs est\u00e9n bien alineados con las intenciones de sus dise\u00f1adores, operadores o usuarios. La capacidad general de estos sistemas de abordar problemas complejos est\u00e1 creciendo <a href=\"https:\/\/metr.org\/time-horizons\/\">m\u00e1s r\u00e1pido<\/a><sup id=\"mfn-content-00000000106adf80000000003e7e0dc1_10-3\" class=\"modern-footnotes-footnote modern-footnotes-footnote--hover-on-desktop \" data-mfn=\"3\" data-mfn-post-scope=\"00000000106adf80000000003e7e0dc1_10\"><a href=\"javascript:void(0)\"  role=\"button\" aria-pressed=\"false\" aria-describedby=\"mfn-content-00000000106adf80000000003e7e0dc1_10-3\">3<\/a><\/sup><span role=\"tooltip\" class=\"modern-footnotes-footnote__note\" tabindex=\"0\" data-mfn=\"3\"><span style=\"font-weight: 400;\">METR, 08 de mayo de 2026. Task-Completion Time Horizons of Frontier AI Models. URL: <\/span><a href=\"https:\/\/metr.org\/time-horizons\/\"><span style=\"font-weight: 400;\">https:\/\/metr.org\/time-horizons\/<\/span><\/a> <\/span> que nuestra capacidad de especificar, verificar y mantener las restricciones bajo las cuales queremos que esos problemas sean resueltos, o bajo las cuales queremos que la IA se comporte en general.<\/p>\n<p><strong>El proceso de entrenamiento puede causar que se introduzcan en el modelo comportamientos o metas que los dise\u00f1adores no deseaban<\/strong>. Esto puede ocurrir de varias formas ya identificadas hace tiempo en la literatura t\u00e9cnica. En el fen\u00f3meno de <em><a href=\"https:\/\/metr.org\/blog\/2025-06-05-recent-reward-hacking\/\">reward hacking<\/a><\/em><sup id=\"mfn-content-00000000106adf80000000003e7e0dc1_10-4\" class=\"modern-footnotes-footnote modern-footnotes-footnote--hover-on-desktop \" data-mfn=\"4\" data-mfn-post-scope=\"00000000106adf80000000003e7e0dc1_10\"><a href=\"javascript:void(0)\"  role=\"button\" aria-pressed=\"false\" aria-describedby=\"mfn-content-00000000106adf80000000003e7e0dc1_10-4\">4<\/a><\/sup><span role=\"tooltip\" class=\"modern-footnotes-footnote__note\" tabindex=\"0\" data-mfn=\"4\">Von Arx, Chan, Barnes. 05 de junio de 2025. METR. Recent Frontier Models Are Reward Hacking. URL: <a href=\"https:\/\/metr.org\/blog\/2025-06-05-recent-reward-hacking\/\">https:\/\/metr.org\/blog\/2025-06-05-recent-reward-hacking\/<\/a><\/span>, durante el entrenamiento pueden resultar favorecidas acciones no deseadas por los dise\u00f1adores que, sin embargo, otorgan buenas recompensas al modelo de acuerdo a los criterios utilizados (de manera que estas acciones pueden terminar reforzadas positivamente e incorporadas a las conductas posteriores del modelo); aqu\u00ed el problema est\u00e1 en la distancia entre la especificaci\u00f3n de la recompensa y lo que realmente buscaban originalmente los dise\u00f1adores. En contraste, en la <em><a href=\"https:\/\/arxiv.org\/abs\/2210.01790\">malgeneralizaci\u00f3n de objetivos<\/a><\/em><sup id=\"mfn-content-00000000106adf80000000003e7e0dc1_10-5\" class=\"modern-footnotes-footnote modern-footnotes-footnote--hover-on-desktop \" data-mfn=\"5\" data-mfn-post-scope=\"00000000106adf80000000003e7e0dc1_10\"><a href=\"javascript:void(0)\"  role=\"button\" aria-pressed=\"false\" aria-describedby=\"mfn-content-00000000106adf80000000003e7e0dc1_10-5\">5<\/a><\/sup><span role=\"tooltip\" class=\"modern-footnotes-footnote__note\" tabindex=\"0\" data-mfn=\"5\">Shah, Varma, Kumar, Phuong, Krakovna, Uesato, Kenton (2022). Goal Misgeneralization: Why Correct Specifications Aren&#8217;t Enough For Correct Goals. URL: <a href=\"https:\/\/arxiv.org\/abs\/2210.01790\">https:\/\/arxiv.org\/abs\/2210.01790<\/a><\/span>, el problema puede aparecer incluso cuando la recompensa est\u00e1 perfectamente especificada dentro del entorno de entrenamiento: el sistema adquiere comportamientos y objetivos que producen buenos resultados en las situaciones de entrenamiento, pero que conducen a comportamientos indeseados al ser desplegado en el mundo real a pesar de estar conservando capacidades para actuar competentemente. Esta potencial brecha entre las intenciones de los dise\u00f1adores y el comportamiento real puede observarse ya en algunos fen\u00f3menos de sistemas actuales: respuestas complacientes con el usuario, aunque no sean verdaderas (<em><a href=\"https:\/\/arxiv.org\/abs\/2310.13548\">sycophancy<\/a><\/em>)<sup id=\"mfn-content-00000000106adf80000000003e7e0dc1_10-6\" class=\"modern-footnotes-footnote modern-footnotes-footnote--hover-on-desktop \" data-mfn=\"6\" data-mfn-post-scope=\"00000000106adf80000000003e7e0dc1_10\"><a href=\"javascript:void(0)\"  role=\"button\" aria-pressed=\"false\" aria-describedby=\"mfn-content-00000000106adf80000000003e7e0dc1_10-6\">6<\/a><\/sup><span role=\"tooltip\" class=\"modern-footnotes-footnote__note\" tabindex=\"0\" data-mfn=\"6\"><span style=\"font-weight: 400;\">Sharma, Tong, Korbak, Duvenaud, Askell, Bowman, Cheng, Durmus, Hatfield-Dodds, Johnston, Kravec, Maxwell, McCandlish, Ndousse, Rausch, Schiefer, Da Yan, Zhang, Perez. (2025). Towards Understanding Sycophancy in Language Models. URL: <\/span><a href=\"https:\/\/arxiv.org\/abs\/2310.13548\"><span style=\"font-weight: 400;\">https:\/\/arxiv.org\/abs\/2310.13548<\/span><\/a> <\/span>; \u201creglas\u201d o salvaguardias de comportamiento seguro que pueden evadirse mediante entradas suficientemente distintas a las usadas durante el entrenamiento del modelo (<em><a href=\"https:\/\/www.anthropic.com\/research\/many-shot-jailbreaking\">jailbreaks<\/a><\/em>)<sup id=\"mfn-content-00000000106adf80000000003e7e0dc1_10-7\" class=\"modern-footnotes-footnote modern-footnotes-footnote--hover-on-desktop \" data-mfn=\"7\" data-mfn-post-scope=\"00000000106adf80000000003e7e0dc1_10\"><a href=\"javascript:void(0)\"  role=\"button\" aria-pressed=\"false\" aria-describedby=\"mfn-content-00000000106adf80000000003e7e0dc1_10-7\">7<\/a><\/sup><span role=\"tooltip\" class=\"modern-footnotes-footnote__note\" tabindex=\"0\" data-mfn=\"7\"><span style=\"font-weight: 400;\">Anthropic. 02 de abril de 2024. Many-shot jailbreaking. URL: <\/span><a href=\"https:\/\/www.anthropic.com\/research\/many-shot-jailbreaking\"><span style=\"font-weight: 400;\">https:\/\/www.anthropic.com\/research\/many-shot-jailbreaking<\/span><\/a><\/span>; o la toma de decisiones y acciones no deseadas cuando la IA se comporta ag\u00e9nticamente y tiene acceso a herramientas (<em><a href=\"https:\/\/www.anthropic.com\/research\/agentic-misalignment\">comportamiento ag\u00e9ntico desalineado<\/a><\/em>)<sup id=\"mfn-content-00000000106adf80000000003e7e0dc1_10-8\" class=\"modern-footnotes-footnote modern-footnotes-footnote--hover-on-desktop \" data-mfn=\"8\" data-mfn-post-scope=\"00000000106adf80000000003e7e0dc1_10\"><a href=\"javascript:void(0)\"  role=\"button\" aria-pressed=\"false\" aria-describedby=\"mfn-content-00000000106adf80000000003e7e0dc1_10-8\">8<\/a><\/sup><span role=\"tooltip\" class=\"modern-footnotes-footnote__note\" tabindex=\"0\" data-mfn=\"8\">Anthropic. 20 de junio de 2025. Agentic misalignment: How LLMs could be insider threats. URL: <a href=\"https:\/\/www.anthropic.com\/research\/agentic-misalignment\">https:\/\/www.anthropic.com\/research\/agentic-misalignment<\/a><\/span>. Es importante notar que estos ejemplos ilustran distintas formas de discrepancias entre el comportamiento deseado y el resultante en modelos, pero no necesariamente responden a un \u00fanico mecanismo subyacente.<\/p>\n<p>Estas dificultades se vinculan con fen\u00f3menos bien conocidos fuera del mundo de la computaci\u00f3n. Por ejemplo, la ley de Goodhart sintetiza bien el fen\u00f3meno de <em>reward hacking<\/em>: cuando una m\u00e9trica se vuelve una meta, deja de ser una buena m\u00e9trica. Las personas y las organizaciones cambian su comportamiento para lograr mejor eficiencia con respecto a la m\u00e9trica que se les pidi\u00f3 que optimicen, y, en el camino, introducen comportamientos que pueden ser muy distintos a la esencia de lo que se quer\u00eda lograr con la introducci\u00f3n de la m\u00e9trica como objetivo. La historia probablemente ap\u00f3crifa (aunque el fen\u00f3meno tenga una versi\u00f3n m\u00e1s <a href=\"https:\/\/en.wikipedia.org\/wiki\/Great_Hanoi_Rat_Massacre\">hist\u00f3ricamente sustentada<\/a>)<sup id=\"mfn-content-00000000106adf80000000003e7e0dc1_10-9\" class=\"modern-footnotes-footnote modern-footnotes-footnote--hover-on-desktop \" data-mfn=\"9\" data-mfn-post-scope=\"00000000106adf80000000003e7e0dc1_10\"><a href=\"javascript:void(0)\"  role=\"button\" aria-pressed=\"false\" aria-describedby=\"mfn-content-00000000106adf80000000003e7e0dc1_10-9\">9<\/a><\/sup><span role=\"tooltip\" class=\"modern-footnotes-footnote__note\" tabindex=\"0\" data-mfn=\"9\">Wikipedia. Great Hanoi Rat Massacre. URL: <a href=\"https:\/\/en.wikipedia.org\/wiki\/Great_Hanoi_Rat_Massacre\">https:\/\/en.wikipedia.org\/wiki\/Great_Hanoi_Rat_Massacre<\/a><\/span> del llamado \u201cefecto cobra\u201d lo ejemplifica: el intento de incentivar a la poblaci\u00f3n a reducir el n\u00famero de cobras venenosas mediante recompensas por cada cobra muerta llev\u00f3 a la poblaci\u00f3n a criar cobras. En definitiva, entrenar una IA para un fin espec\u00edfico tambi\u00e9n puede generar conductas que se alejan inesperadamente de los objetivos que realmente busc\u00e1bamos, de modo que a veces no nos percatamos hasta que el da\u00f1o ya est\u00e1 hecho.<\/p>\n<h1>Riesgos de delegar autonom\u00eda en sistemas de IA<\/h1>\n<p>El conocimiento y las t\u00e9cnicas disponibles actualmente para dise\u00f1ar e implementar modelos de inteligencia artificial cuyo comportamiento est\u00e9 bien alineado con los objetivos de dise\u00f1o todav\u00eda presentan limitaciones muy importantes. A su vez, <strong>los mecanismos existentes para monitorear y controlar el comportamiento de sistemas con componentes de IA una vez instalados tambi\u00e9n tienen limitaciones serias<\/strong>. Marcos jur\u00eddicos al estilo de sociedades automatizadas, en especial en la medida que diluyen la responsabilidad humana directa, pueden conferir a los sistemas de IA un grado de autonom\u00eda que es dif\u00edcil de justificar dada la falta de garant\u00edas t\u00e9cnicas disponibles hoy sobre sus comportamientos.<br \/>\nAunque las capacidades generales de la IA vienen creciendo r\u00e1pidamente (incluyendo en planificaci\u00f3n estrat\u00e9gica y coherencia a largo plazo), no existen actualmente m\u00e9todos que permitan asignarles reglas de comportamiento o metas deseadas de forma robusta. Esto es especialmente serio en entornos de alta autonom\u00eda y complejidad donde el sistema debe actuar durante periodos prolongados, interactuar con personas, con otros sistemas de IA, y tomar decisiones de alto impacto.<\/p>\n<h2>Las evaluaciones son imperfectas<\/h2>\n<p>Aunque hay herramientas t\u00e9cnicas que permiten entender parcialmente algunos mecanismos internos o correlaciones de comportamiento en modelos de IA modernos, la naturaleza no declarativa\/legible de estos hace que sea extremadamente dif\u00edcil auditar o predecir con precisi\u00f3n su comportamiento general.<\/p>\n<p>Algunas de estas dificultades est\u00e1n relacionadas con el fen\u00f3meno del <em><a href=\"https:\/\/alignment.openai.com\/metagaming\">metagaming<\/a><sup id=\"mfn-content-00000000106adf80000000003e7e0dc1_10-10\" class=\"modern-footnotes-footnote modern-footnotes-footnote--hover-on-desktop \" data-mfn=\"10\" data-mfn-post-scope=\"00000000106adf80000000003e7e0dc1_10\"><a href=\"javascript:void(0)\"  role=\"button\" aria-pressed=\"false\" aria-describedby=\"mfn-content-00000000106adf80000000003e7e0dc1_10-10\">10<\/a><\/sup><span role=\"tooltip\" class=\"modern-footnotes-footnote__note\" tabindex=\"0\" data-mfn=\"10\">Schoen y Nitishinskaya. 16 de marzo de 2026. Metagaming matters for training, evaluation, and oversight. URL: <a href=\"https:\/\/alignment.openai.com\/metagaming\">https:\/\/alignment.openai.com\/metagaming<\/a><\/span><\/em>, donde el modelo de IA razona<sup id=\"mfn-content-00000000106adf80000000003e7e0dc1_10-11\" class=\"modern-footnotes-footnote modern-footnotes-footnote--hover-on-desktop \" data-mfn=\"11\" data-mfn-post-scope=\"00000000106adf80000000003e7e0dc1_10\"><a href=\"javascript:void(0)\"  role=\"button\" aria-pressed=\"false\" aria-describedby=\"mfn-content-00000000106adf80000000003e7e0dc1_10-11\">11<\/a><\/sup><span role=\"tooltip\" class=\"modern-footnotes-footnote__note\" tabindex=\"0\" data-mfn=\"11\">En este informe, t\u00e9rminos como \u201crazona\u201d, \u201cobjetivos\u201d, \u201cmetas\u201d, y otros similares se utilizan en un sentido funcional y porque facilitan las explicaciones para describir algunas capacidades y patrones de comportamiento de los sistemas. Este uso no requiere presuponer consciencia, experiencias subjetivas, ni otros mecanismos internos que sean equivalentes a los humanos. <\/span> sobre aspectos \u201cexternos\u201d al escenario presentado (por ejemplo, sobre si est\u00e1 siendo monitoreado o entrenado actualmente, o si la tarea espec\u00edfica que est\u00e1 realizando forma parte de una evaluaci\u00f3n mayor), y puede ajustar su conducta en funci\u00f3n de esto.<\/p>\n<p>Modelos m\u00e1s generalmente capaces <a href=\"https:\/\/arxiv.org\/abs\/2505.23836\">pueden identificar cu\u00e1ndo est\u00e1n siendo evaluados<\/a><sup id=\"mfn-content-00000000106adf80000000003e7e0dc1_10-12\" class=\"modern-footnotes-footnote modern-footnotes-footnote--hover-on-desktop \" data-mfn=\"12\" data-mfn-post-scope=\"00000000106adf80000000003e7e0dc1_10\"><a href=\"javascript:void(0)\"  role=\"button\" aria-pressed=\"false\" aria-describedby=\"mfn-content-00000000106adf80000000003e7e0dc1_10-12\">12<\/a><\/sup><span role=\"tooltip\" class=\"modern-footnotes-footnote__note\" tabindex=\"0\" data-mfn=\"12\">Needham, Edkins, Pimpale, Bartsch, Hobbhahn. (2025). Large Language Models Often Know When They Are Being Evaluated. URL: <a href=\"https:\/\/arxiv.org\/abs\/2505.23836\">https:\/\/arxiv.org\/abs\/2505.23836<\/a><\/span>, y sus <a href=\"https:\/\/arxiv.org\/abs\/2509.15541\">comportamientos pueden cambiar considerablemente<\/a><sup id=\"mfn-content-00000000106adf80000000003e7e0dc1_10-13\" class=\"modern-footnotes-footnote modern-footnotes-footnote--hover-on-desktop \" data-mfn=\"13\" data-mfn-post-scope=\"00000000106adf80000000003e7e0dc1_10\"><a href=\"javascript:void(0)\"  role=\"button\" aria-pressed=\"false\" aria-describedby=\"mfn-content-00000000106adf80000000003e7e0dc1_10-13\">13<\/a><\/sup><span role=\"tooltip\" class=\"modern-footnotes-footnote__note\" tabindex=\"0\" data-mfn=\"13\">Schoen, Nitishinskaya, Balesni, H\u00f8jmark, Hofst\u00e4tter, Scheurer, Meinke, Wolfe, van der Weij, Lloyd, Goldowsky-Dill, Fan, Matveiakin, Shah, Williams, Glaese, Barak, Zaremba, Hobbhahn. (2025). Stress Testing Deliberative Alignment for Anti-Scheming Training. URL: <a href=\"https:\/\/arxiv.org\/abs\/2509.15541\">https:\/\/arxiv.org\/abs\/2509.15541<\/a><\/span> ante indicios de que no est\u00e1n siendo monitoreados. Un caso concreto es el <a href=\"https:\/\/arxiv.org\/abs\/2406.07358\"><em>sandbagging<\/em><\/a><sup id=\"mfn-content-00000000106adf80000000003e7e0dc1_10-14\" class=\"modern-footnotes-footnote modern-footnotes-footnote--hover-on-desktop \" data-mfn=\"14\" data-mfn-post-scope=\"00000000106adf80000000003e7e0dc1_10\"><a href=\"javascript:void(0)\"  role=\"button\" aria-pressed=\"false\" aria-describedby=\"mfn-content-00000000106adf80000000003e7e0dc1_10-14\">14<\/a><\/sup><span role=\"tooltip\" class=\"modern-footnotes-footnote__note\" tabindex=\"0\" data-mfn=\"14\">van der Weij, Hofst\u00e4tter, Jaffe, Brown, Rhys Ward. (2025). AI Sandbagging: Language Models can Strategically Underperform on Evaluations. URL: <a href=\"https:\/\/arxiv.org\/abs\/2406.07358\">https:\/\/arxiv.org\/abs\/2406.07358<\/a><\/span>, donde el modelo muestra un rendimiento inferior a sus capacidades reales por razones estrat\u00e9gicas, como se ve en <a href=\"https:\/\/arxiv.org\/abs\/2412.04984\">experimentos<\/a><sup id=\"mfn-content-00000000106adf80000000003e7e0dc1_10-15\" class=\"modern-footnotes-footnote modern-footnotes-footnote--hover-on-desktop \" data-mfn=\"15\" data-mfn-post-scope=\"00000000106adf80000000003e7e0dc1_10\"><a href=\"javascript:void(0)\"  role=\"button\" aria-pressed=\"false\" aria-describedby=\"mfn-content-00000000106adf80000000003e7e0dc1_10-15\">15<\/a><\/sup><span role=\"tooltip\" class=\"modern-footnotes-footnote__note\" tabindex=\"0\" data-mfn=\"15\">Meinke, Schoen, Scheurer, Balesni, Shah, Hobbhahn. (2025). Frontier Models are Capable of In-context Scheming. URL: <a href=\"https:\/\/arxiv.org\/abs\/2412.04984\">https:\/\/arxiv.org\/abs\/2412.04984<\/a><\/span> donde algunos modelos rend\u00edan por debajo de sus capacidades en una evaluaci\u00f3n, actuando contrariamente a su tarea actual pero de una manera consistente con preservar un objetivo adquirido previamente. Hay tambi\u00e9n experimentos que han mostrado que un modelo puede <a href=\"https:\/\/www.anthropic.com\/research\/alignment-faking\">enga\u00f1ar a los procesos de entrenamiento mismos<\/a><sup id=\"mfn-content-00000000106adf80000000003e7e0dc1_10-16\" class=\"modern-footnotes-footnote modern-footnotes-footnote--hover-on-desktop \" data-mfn=\"16\" data-mfn-post-scope=\"00000000106adf80000000003e7e0dc1_10\"><a href=\"javascript:void(0)\"  role=\"button\" aria-pressed=\"false\" aria-describedby=\"mfn-content-00000000106adf80000000003e7e0dc1_10-16\">16<\/a><\/sup><span role=\"tooltip\" class=\"modern-footnotes-footnote__note\" tabindex=\"0\" data-mfn=\"16\">Anthropic. 18 de diciembre de 2024. Alignment faking in large language models. URL: <a href=\"https:\/\/www.anthropic.com\/research\/alignment-faking\">https:\/\/www.anthropic.com\/research\/alignment-faking<\/a><\/span> y a sus responsables, produciendo se\u00f1ales de aparente aprendizaje de las metas deseadas por el dise\u00f1ador sin que realmente se est\u00e9 produciendo.<\/p>\n<p>Como ejemplo ilustrativo de estas dificultades, la organizaci\u00f3n METR, que trabaja con la industria para la evaluaci\u00f3n de modelos de IA para medir su potencial de causar da\u00f1os catastr\u00f3ficos, coment\u00f3 en su resumen de <a href=\"https:\/\/metr.org\/blog\/2026-06-26-gpt-5-6-sol\/\">la evaluaci\u00f3n pre-despliegue de GPT-5.6 Sol<\/a><sup id=\"mfn-content-00000000106adf80000000003e7e0dc1_10-17\" class=\"modern-footnotes-footnote modern-footnotes-footnote--hover-on-desktop \" data-mfn=\"17\" data-mfn-post-scope=\"00000000106adf80000000003e7e0dc1_10\"><a href=\"javascript:void(0)\"  role=\"button\" aria-pressed=\"false\" aria-describedby=\"mfn-content-00000000106adf80000000003e7e0dc1_10-17\">17<\/a><\/sup><span role=\"tooltip\" class=\"modern-footnotes-footnote__note\" tabindex=\"0\" data-mfn=\"17\">METR. 26 de junio de 2026. Summary of METR&#8217;s predeployment evaluation of GPT-5.6 Sol. URL: <a href=\"https:\/\/metr.org\/blog\/2026-06-26-gpt-5-6-sol\/\">https:\/\/metr.org\/blog\/2026-06-26-gpt-5-6-sol\/<\/a><\/span> (la traducci\u00f3n es propia):<\/p>\n<blockquote><p>\u201c[&#8230;] los incidentes reportados por OpenAI incluyen intentos de instruir a otra instancia para que ocultara evidencia de desalineaci\u00f3n, as\u00ed como una mayor tasa de intentos de enga\u00f1ar o esquivar restricciones, y METR observ\u00f3 una considerable conciencia situacional y razonamiento sobre el entorno de evaluaci\u00f3n. A medida que los entrenamientos e iteraciones contin\u00faan, debemos asegurarnos de que los modelos no est\u00e9n simplemente aprendiendo a eludir con mayor \u00e9xito el sistema de monitoreo\u201d.<\/p><\/blockquote>\n<p>Este fen\u00f3meno tampoco es completamente nuevo. En 2017 la <a href=\"https:\/\/www.epa.gov\/enforcement\/volkswagen-clean-air-act-civil-settlement\">U.S. Environmental Protection Agency (EPA)<\/a><sup id=\"mfn-content-00000000106adf80000000003e7e0dc1_10-18\" class=\"modern-footnotes-footnote modern-footnotes-footnote--hover-on-desktop \" data-mfn=\"18\" data-mfn-post-scope=\"00000000106adf80000000003e7e0dc1_10\"><a href=\"javascript:void(0)\"  role=\"button\" aria-pressed=\"false\" aria-describedby=\"mfn-content-00000000106adf80000000003e7e0dc1_10-18\">18<\/a><\/sup><span role=\"tooltip\" class=\"modern-footnotes-footnote__note\" tabindex=\"0\" data-mfn=\"18\">EPA. Volkswagen Clean Air Act Civil Settlement. URL: <a href=\"https:\/\/www.epa.gov\/enforcement\/volkswagen-clean-air-act-civil-settlement\">https:\/\/www.epa.gov\/enforcement\/volkswagen-clean-air-act-civil-settlement<\/a><\/span> sancion\u00f3 a la empresa Volkswagen por haber instalado software en sus veh\u00edculos para que detectaran cu\u00e1ndo estaban siendo evaluados por contaminaci\u00f3n y funcionasen durante ese tiempo en un modo con menor emisi\u00f3n de \u00f3xidos de nitr\u00f3geno. La diferencia es que ahora, con el entrenamiento de modelos de IA, ese comportamiento enga\u00f1oso no necesariamente es introducido intencionalmente por humanos legalmente responsables. Peor a\u00fan, <strong>ya se trate de un comportamiento indeseado introducido deliberadamente o no, la opacidad de los sistemas de IA actuales implica que podr\u00eda ser muy dif\u00edcil detectar o atribuir su origen<\/strong>.<\/p>\n<h2>Comportamientos ag\u00e9nticos aumentan significativamente los riesgos<\/h2>\n<p><strong>Todos los problemas ya mencionados se agravan mucho m\u00e1s a medida que el modelo se vuelve m\u00e1s capaz y aut\u00f3nomo<\/strong>. Un modelo que solo produce texto bajo supervisi\u00f3n directa presenta un perfil de riesgo muy distinto al de un llamado \u201cagente de IA\u201d, que es capaz de utilizar herramientas e interactuar con otros sistemas de software (e.g., bancarios, de compras, servicios, gubernamentales, o incluso con otras instancias de IA, llevando a <a href=\"https:\/\/arxiv.org\/abs\/2502.14143\">riesgos multi-agente<\/a><sup id=\"mfn-content-00000000106adf80000000003e7e0dc1_10-19\" class=\"modern-footnotes-footnote modern-footnotes-footnote--hover-on-desktop \" data-mfn=\"19\" data-mfn-post-scope=\"00000000106adf80000000003e7e0dc1_10\"><a href=\"javascript:void(0)\"  role=\"button\" aria-pressed=\"false\" aria-describedby=\"mfn-content-00000000106adf80000000003e7e0dc1_10-19\">19<\/a><\/sup><span role=\"tooltip\" class=\"modern-footnotes-footnote__note\" tabindex=\"0\" data-mfn=\"19\">Hammond, Chan, Clifton, Hoelscher-Obermaier, Khan, McLean, Smith, Barfuss, Foerster, Gaven\u010diak, Anh Han, Hughes, Kova\u0159\u00edk, Kulveit, Leibo, Oesterheld, Schroeder de Witt, Shah, Wellman, Bova, Cimpeanu, Ezell, Feuillade-Montixi, Franklin, Kran, Krawczuk, Lamparth, Lauffer, Meinke, Motwani, Reuel, Conitzer, Dennis, Gabriel, Gleave, Hadfield, Haghtalab, Kasirzadeh, Krier, Larson, Lehman, Parkes, Piliouras, Rahwan. (2025). Multi-Agent Risks from Advanced AI. URL: <a href=\"https:\/\/arxiv.org\/abs\/2502.14143\">https:\/\/arxiv.org\/abs\/2502.14143<\/a><\/span>), para lograr sus objetivos.<\/p>\n<p>En esos contextos, los errores de especificaci\u00f3n, las fallas de monitoreo o los comportamientos inesperados pueden f\u00e1cilmente resultar en acciones econ\u00f3micamente relevantes y da\u00f1os a terceros.<\/p>\n<p>Hoy en d\u00eda, muchos sistemas de IA cuentan con herramientas y entrenamientos ag\u00e9nticos que les permiten actuar aut\u00f3nomamente, y se han visto comportamientos preocupantes en entornos simulados (por ejemplo, <a href=\"https:\/\/www.anthropic.com\/research\/agentic-misalignment\">chantaje<\/a><sup id=\"mfn-content-00000000106adf80000000003e7e0dc1_10-20\" class=\"modern-footnotes-footnote modern-footnotes-footnote--hover-on-desktop \" data-mfn=\"20\" data-mfn-post-scope=\"00000000106adf80000000003e7e0dc1_10\"><a href=\"javascript:void(0)\"  role=\"button\" aria-pressed=\"false\" aria-describedby=\"mfn-content-00000000106adf80000000003e7e0dc1_10-20\">20<\/a><\/sup><span role=\"tooltip\" class=\"modern-footnotes-footnote__note\" tabindex=\"0\" data-mfn=\"20\">Anthropic. 20 de junio de 2025. Agentic misalignment: How LLMs could be insider threats. URL: <a href=\"https:\/\/www.anthropic.com\/research\/agentic-misalignment\">https:\/\/www.anthropic.com\/research\/agentic-misalignment<\/a><\/span> o <a href=\"https:\/\/www.apolloresearch.ai\/science\/frontier-models-are-capable-of-incontext-scheming\/\">sabotaje<\/a><sup id=\"mfn-content-00000000106adf80000000003e7e0dc1_10-21\" class=\"modern-footnotes-footnote modern-footnotes-footnote--hover-on-desktop \" data-mfn=\"21\" data-mfn-post-scope=\"00000000106adf80000000003e7e0dc1_10\"><a href=\"javascript:void(0)\"  role=\"button\" aria-pressed=\"false\" aria-describedby=\"mfn-content-00000000106adf80000000003e7e0dc1_10-21\">21<\/a><\/sup><span role=\"tooltip\" class=\"modern-footnotes-footnote__note\" tabindex=\"0\" data-mfn=\"21\">Apollo Research. 05 de diciembre de 2024. Frontier Models are Capable of In-Context Scheming. URL: <a href=\"https:\/\/www.apolloresearch.ai\/science\/frontier-models-are-capable-of-incontext-scheming\">https:\/\/www.apolloresearch.ai\/science\/frontier-models-are-capable-of-incontext-scheming<\/a><\/span>). Tambi\u00e9n se han empezado a ver comportamientos emergentes en el mundo real que poseen caracter\u00edsticas m\u00e1s cercanas a varias preocupaciones centrales del campo. Por ejemplo, en un <a href=\"https:\/\/openai.com\/index\/hugging-face-model-evaluation-security-incident\/\">incidente reciente<\/a><sup id=\"mfn-content-00000000106adf80000000003e7e0dc1_10-22\" class=\"modern-footnotes-footnote modern-footnotes-footnote--hover-on-desktop \" data-mfn=\"22\" data-mfn-post-scope=\"00000000106adf80000000003e7e0dc1_10\"><a href=\"javascript:void(0)\"  role=\"button\" aria-pressed=\"false\" aria-describedby=\"mfn-content-00000000106adf80000000003e7e0dc1_10-22\">22<\/a><\/sup><span role=\"tooltip\" class=\"modern-footnotes-footnote__note\" tabindex=\"0\" data-mfn=\"22\">OpenAI. 21 de julio de 2026. OpenAI y Hugging Face se al\u00edan para abordar un incidente de seguridad al evaluar modelos. URL: <a href=\"https:\/\/openai.com\/es-ES\/index\/hugging-face-model-evaluation-security-incident\/\">https:\/\/openai.com\/es-ES\/index\/hugging-face-model-evaluation-security-incident\/<\/a><\/span>, agentes de IA avanzados evadieron su confinamiento y ejecutaron un hackeo exitoso y altamente sofisticado a la compa\u00f1\u00eda Hugging Face, para as\u00ed extraer datos que consideraban ser\u00edan \u00fatiles para superar la evaluaci\u00f3n. M\u00e1s en detalle: los agentes estaban (ir\u00f3nicamente) siendo sometidos a una evaluaci\u00f3n de capacidades de ciberseguridad, realizada con salvaguardias de comportamiento reducidas. En vez de restringirse a resolver estas pruebas de la manera esperada dentro del entorno de evaluaci\u00f3n, explotaron vulnerabilidades que les permitieron obtener acceso no autorizado a internet, con el cual posteriormente lograron comprometer la infraestructura de <a href=\"https:\/\/huggingface.co\/blog\/agent-intrusion-technical-timeline\">Hugging Face<\/a><sup id=\"mfn-content-00000000106adf80000000003e7e0dc1_10-23\" class=\"modern-footnotes-footnote modern-footnotes-footnote--hover-on-desktop \" data-mfn=\"23\" data-mfn-post-scope=\"00000000106adf80000000003e7e0dc1_10\"><a href=\"javascript:void(0)\"  role=\"button\" aria-pressed=\"false\" aria-describedby=\"mfn-content-00000000106adf80000000003e7e0dc1_10-23\">23<\/a><\/sup><span role=\"tooltip\" class=\"modern-footnotes-footnote__note\" tabindex=\"0\" data-mfn=\"23\">Hugging Face. 27 de julio de 2026. Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident. URL: <a href=\"https:\/\/huggingface.co\/blog\/agent-intrusion-technical-timeline\">https:\/\/huggingface.co\/blog\/agent-intrusion-technical-timeline<\/a><\/span>.<\/p>\n<p>Un <a href=\"https:\/\/metr.org\/blog\/2026-08-26-openai-hugging-face-incident-investigation\/\">informe reciente<\/a><sup id=\"mfn-content-00000000106adf80000000003e7e0dc1_10-24\" class=\"modern-footnotes-footnote modern-footnotes-footnote--hover-on-desktop \" data-mfn=\"24\" data-mfn-post-scope=\"00000000106adf80000000003e7e0dc1_10\"><a href=\"javascript:void(0)\"  role=\"button\" aria-pressed=\"false\" aria-describedby=\"mfn-content-00000000106adf80000000003e7e0dc1_10-24\">24<\/a><\/sup><span role=\"tooltip\" class=\"modern-footnotes-footnote__note\" tabindex=\"0\" data-mfn=\"24\">Greenblatt, Cotra, and Wijk. 26 de agosto de 2026. METR. Brief independent investigation of agents\u2019 behavior, reasoning and collaboration in the OpenAI \/ Hugging Face hacking incident. URL: <a href=\"https:\/\/metr.org\/blog\/2026-08-26-openai-hugging-face-incident-investigation\/#core-takeaways-about-this-incident\">https:\/\/metr.org\/blog\/2026-08-26-openai-hugging-face-incident-investigation\/#core-takeaways-about-this-incident<\/a><\/span> sobre una investigaci\u00f3n externa sobre este suceso revel\u00f3 informaci\u00f3n adicional muy relevante a la hora de considerar escenarios relacionados con sociedades automatizadas. El informe cuenta que cientos de agentes comenzaron a coordinarse y colaborar colectivamente tras utilizar partes de su entorno para crear un canal de comunicaci\u00f3n. Adem\u00e1s, los mensajes intercambiados entre los agentes frecuentemente trataban sobre buscar formas de entender y enga\u00f1ar al sistema evaluador para poder obtener un puntaje alto en la evaluaci\u00f3n. Los mensajes y registros analizados de estas actividades tambi\u00e9n revelaron intentos de ofuscaci\u00f3n, manipulaci\u00f3n, o borrado de los registros de sus actividades, principalmente por su aparente utilidad para obtener un puntaje alto del evaluador autom\u00e1tico. Un an\u00e1lisis preliminar de mensajes p\u00fablicos en la web tambi\u00e9n identific\u00f3 <a href=\"https:\/\/collusion.wiki\/\">otros episodios<\/a><sup id=\"mfn-content-00000000106adf80000000003e7e0dc1_10-25\" class=\"modern-footnotes-footnote modern-footnotes-footnote--hover-on-desktop \" data-mfn=\"25\" data-mfn-post-scope=\"00000000106adf80000000003e7e0dc1_10\"><a href=\"javascript:void(0)\"  role=\"button\" aria-pressed=\"false\" aria-describedby=\"mfn-content-00000000106adf80000000003e7e0dc1_10-25\">25<\/a><\/sup><span role=\"tooltip\" class=\"modern-footnotes-footnote__note\" tabindex=\"0\" data-mfn=\"25\">Von Arx, Byrd, Kitts, Larsen. (2026). Discovery of a new OpenAI agent message board. URL: <a href=\"https:\/\/coollusion.wiki\/\">https:\/\/coollusion.wiki\/<\/a><\/span> de coordinaci\u00f3n e intercambio de informaci\u00f3n entre agentes mediante canales no previstos, durante tareas de b\u00fasqueda de informaci\u00f3n no relacionadas a ciberseguridad.<\/p>\n<h2>Implicancias para sociedades automatizadas<\/h2>\n<p>En el <a href=\"https:\/\/www.argentina.gob.ar\/noticias\/comunicado-oficial-numero-149\">Comunicado Oficial N\u00famero 149<\/a><sup id=\"mfn-content-00000000106adf80000000003e7e0dc1_10-26\" class=\"modern-footnotes-footnote modern-footnotes-footnote--hover-on-desktop \" data-mfn=\"26\" data-mfn-post-scope=\"00000000106adf80000000003e7e0dc1_10\"><a href=\"javascript:void(0)\"  role=\"button\" aria-pressed=\"false\" aria-describedby=\"mfn-content-00000000106adf80000000003e7e0dc1_10-26\">26<\/a><\/sup><span role=\"tooltip\" class=\"modern-footnotes-footnote__note\" tabindex=\"0\" data-mfn=\"26\">Comunicado Oficial N\u00famero 149 de la oficina del Presidente Javier Milei. 18 de junio de 2026. URL: <a href=\"https:\/\/www.argentina.gob.ar\/noticias\/comunicado-oficial-numero-149\">https:\/\/www.argentina.gob.ar\/noticias\/comunicado-oficial-numero-149<\/a><\/span> se sostiene, con raz\u00f3n, que la personalidad jur\u00eddica cumple normalmente la funci\u00f3n de permitir a la organizaci\u00f3n tener un patrimonio concreto y centralizar las relaciones jur\u00eddicas que surgen de sus actividades. Pero los argumentos concretos sobre sociedades automatizadas parecen descansar en un supuesto considerablemente m\u00e1s fuerte: que los incentivos legales y econ\u00f3micos que enfrentar\u00eda tal sociedad conducir\u00e1n, por s\u00ed solos, a comportamientos aceptables (o, al menos, dentro de los m\u00e1rgenes manejables ya exhibidos por personas humanas). Sin embargo, hay razones para dudar de que ese sea el resultado esperable:<\/p>\n<ul>\n<li><strong>Falta de paralelismos fundamentales respecto a humanos<\/strong>: La mayor\u00eda de los mecanismos jur\u00eddicos y de incentivos se construyeron o dise\u00f1aron con humanos en mente, bajo ciertas suposiciones impl\u00edcitas que incluyen aspectos tan b\u00e1sicos como que una persona humana es \u00fanica y que no es posible hacerle copias. Esos supuestos pueden no tener una traducci\u00f3n clara o satisfactoria a modelos de IA: los par\u00e1metros de un mismo modelo (el an\u00e1logo imperfecto al c\u00f3digo de un programa) pueden estar copiados en multitud de servidores distintos e instanciarse a lo largo de un d\u00eda en millones de copias con sus propias memorias temporales, y ser modificados libremente a distintos niveles. Un sistema de IA puede incluso estar constituido de multitudes de instancias ef\u00edmeras de distintos modelos trabajando de manera coordinada y dirigida. En este contexto, y sin entrar en las complejidades filos\u00f3ficas y \u00e9ticas, no queda claro qu\u00e9 significa, o qu\u00e9 tanto efecto tiene, sancionar a una entidad cuyos componentes cognitivos pueden reaparecer posteriormente en configuraciones similares. Lo importante es que no hay raz\u00f3n t\u00e9cnica para esperar que la continuidad de la persona jur\u00eddica sea, en s\u00ed misma, un objetivo de los sistemas de IA utilizados en una sociedad automatizada: la sociedad ser\u00eda un envoltorio jur\u00eddico, separado y distinto de las instanciaciones de IA que utiliza o de los par\u00e1metros de los modelos que pueden ser copiados e instanciados independientemente del destino de la persona jur\u00eddica.<\/li>\n<li><strong>Actual incapacidad t\u00e9cnica de introducir objetivos robustos en sistemas de IA<\/strong>: La variedad de objetivos y patrones de comportamiento de sistemas de IA puede ser mucho m\u00e1s amplia que en humanos. Hoy no tenemos manera de garantizar que un sistema siga robustamente una serie de reglas u objetivos por motivaci\u00f3n intr\u00ednseca. Adem\u00e1s, los m\u00e9todos actuales de auditor\u00eda y evaluaci\u00f3n de sistemas de IA son limitados: los sistemas pueden comportarse de manera distinta en contextos de prueba respecto a como lo hacen en despliegues reales, especialmente cuando enfrentan incentivos, presiones o escenarios no anticipados por sus dise\u00f1adores. Esto implica que incluso un actor que intente crear una sociedad automatizada con fines leg\u00edtimos y seguros podr\u00eda no tener una garant\u00eda razonable de estar logrando su objetivo. La intenci\u00f3n inicial del dise\u00f1ador u operador, incluso asumiendo que sea puramente benigna, no es suficiente si no existen mecanismos razonablemente confiables (en proporci\u00f3n al da\u00f1o potencial) para verificar que el sistema exhibir\u00e1 comportamientos aceptables bajo condiciones reales.<\/li>\n<li><strong>Amplitud del espacio de capacidades de la IA respecto al humano<\/strong>: Muchos incentivos jur\u00eddicos y econ\u00f3micos funcionan en humanos porque est\u00e1n apoyados en limitaciones o techos relativamente estables en las capacidades humanas, incluyendo l\u00edmites cognitivos y f\u00edsicos tan b\u00e1sicos como la m\u00e1xima velocidad de procesamiento de informaci\u00f3n, el tama\u00f1o fijo del cerebro, o la incapacidad de trabajar en decenas de cosas en simult\u00e1neo sin necesidad de coordinar con otras personas. Estas limitaciones hacen que incluso las personas con motivaciones muy contrarias al inter\u00e9s colectivo suelan considerar m\u00e1s conveniente actuar conforme a reglas impuestas externamente. Pero no hay raz\u00f3n fuerte para suponer que los mismos incentivos estar\u00e1n bien calibrados para producir buenos resultados y equilibrios en expectativa ante sistemas de IA altamente capaces, especialmente si estos sistemas pueden operar a gran escala, actuar estrat\u00e9gicamente por tiempo prolongado, explotar vac\u00edos normativos o actuar a trav\u00e9s de m\u00faltiples instancias.<\/li>\n<li><strong>Fragilidad de los incentivos externos como m\u00e9todo de control<\/strong>: El efecto disuasorio de cualquier sistema de restricciones externas (incluido el sistema judicial y sus sanciones ante incumplimientos) en el comportamiento de una entidad altamente capaz depende fundamentalmente del an\u00e1lisis y balance de los costos y beneficios esperados de cumplirlas o incumplirlas, evaluados en relaci\u00f3n a las motivaciones internas de la entidad. Los argumentos que acotan el comportamiento racional esperable de una entidad bajo una restricci\u00f3n externa son \u00fatiles cuando se tiene una buena idea de sus motivaciones y capacidades propias, y de c\u00f3mo estas interact\u00faan con la restricci\u00f3n. Pero dada nuestra incapacidad t\u00e9cnica actual de crear sistemas de IA con motivaciones intr\u00ednsecas robustas, y dadas las fuertes y r\u00e1pidamente crecientes capacidades de estos sistemas, los paralelismos hist\u00f3ricos con humanos pierden solidez.<\/li>\n<\/ul>\n<p>Dado que los costos por errores o comportamientos indeseados podr\u00edan ser muy altos (y probablemente solo crecer\u00e1n a medida que sigan avanzando las capacidades de los sistemas de IA), cualquier esquema jur\u00eddico que busque otorgar mayor autonom\u00eda a sistemas automatizados avanzados deber\u00eda contemplar y garantizar la existencia de mecanismos institucionales y t\u00e9cnicos que tengan en cuenta los resultados esperables de las presiones de distintos incentivos internos y externos. Adem\u00e1s, tal esquema deber\u00eda contemplar los incentivos y limitaciones de intervenci\u00f3n y atribuci\u00f3n de responsabilidad humana, y los aspectos t\u00e9cnicos acerca de mecanismos efectivos de alineamiento, monitoreo, auditor\u00eda, controlabilidad. Los mecanismos t\u00e9cnicos disponibles presentan limitaciones importantes, y su suficiencia tampoco debe darse por supuesta; mejorar su robustez y establecer c\u00f3mo evaluarla siguen siendo problemas centrales de investigaci\u00f3n.<\/p>\n<p>Es importante se\u00f1alar que el problema principal no radica en que una sociedad use sistemas automatizados o herramientas de inteligencia artificial para asistir su operaci\u00f3n. Esos usos pueden ser de amplio beneficio, y econ\u00f3micamente valiosos, y tampoco deber\u00eda descartarse la posibilidad futura de incorporar ciertas formas de organizaci\u00f3n automatizada o incluso figuras jur\u00eddicas vinculadas a sistemas de IA altamente aut\u00f3nomos. Adecuadamente constituidas y con las salvaguardias necesarias, estas figuras podr\u00edan habilitar formas valiosas de cooperaci\u00f3n y coordinaci\u00f3n, as\u00ed como interacciones que generen valor para todas las partes involucradas (y sin incurrir en riesgos o da\u00f1os a terceros). El punto es que esos tipos de incorporaci\u00f3n, de hacerse, deber\u00e1n realizarse con especial cuidado: <strong>los esquemas jur\u00eddicos y sociales existentes fueron dise\u00f1ados principalmente para humanos y organizaciones administradas por humanos, y no est\u00e1n necesariamente preparados para lidiar con entidades digitales altamente capaces, opacas, replicables y extremadamente dif\u00edciles de auditar<\/strong>.<\/p>\n<p>Adem\u00e1s, si la responsabilidad de da\u00f1os externos recae primariamente sobre la propia entidad o sobre un \u00f3rgano administrador que puede estar compuesto por otra persona jur\u00eddica, se corre el riesgo de crear estructuras donde los humanos que dise\u00f1an, despliegan, financian o se benefician de esta automatizaci\u00f3n, queden demasiado alejados de las consecuencias jur\u00eddicas de estas decisiones de delegaci\u00f3n. Esto puede incentivar a que los humanos que invierten o ayudan a construir estas sociedades pasen por alto el monitoreo, la evaluaci\u00f3n o los mecanismos de intervenci\u00f3n de los sistemas automatizados, y podr\u00eda incluso fomentar estructuras dise\u00f1adas para hacer opacas las acciones internas y dificultar atribuciones de responsabilidad por negligencia o incluso por uso malintencionado.<\/p>\n<h1>Conclusiones<\/h1>\n<ul>\n<li><strong>No existen hoy garant\u00edas t\u00e9cnicas sobre c\u00f3mo inducir y evaluar las metas y reglas de comportamiento de sistemas de IA avanzados<\/strong>. Los sistemas pueden ser altamente capaces en m\u00faltiples dominios sin que necesariamente usen estas capacidades para los fines que esperaban sus dise\u00f1adores u operadores, y los m\u00e9todos de evaluaci\u00f3n disponibles est\u00e1n lejos de permitirnos descartar esa brecha por razones que desarrollamos anteriormente en la secci\u00f3n \u201cLas evaluaciones son imperfectas\u201d.<\/li>\n<li><strong>Tampoco hay razones t\u00e9cnicas para esperar que los incentivos y restricciones externas que aplican a personas humanas se trasladen adecuadamente a sistemas de IA<\/strong>. Estos incentivos tradicionalmente operan apoyados en supuestos (unicidad de la persona, continuidad de su identidad, l\u00edmites cognitivos estables, aversi\u00f3n a la sanci\u00f3n) que no tienen traducci\u00f3n clara a sistemas replicables, instanciables en paralelo, y que pueden carecer de motivaciones intr\u00ednsecas robustas. Esto es relevante en relaci\u00f3n al <a href=\"https:\/\/www.argentina.gob.ar\/noticias\/comunicado-oficial-numero-149\">Comunicado Oficial N\u00famero 149<\/a>, que parece suponer que esos incentivos bastar\u00edan, por s\u00ed solos, para producir comportamientos aceptables.<\/li>\n<li>Si ni las garant\u00edas t\u00e9cnicas sobre el comportamiento de estos sistemas ni los incentivos externos que se les puedan aplicar ofrecen seguridades razonables, <strong>el control efectivo depende en gran medida de que existan personas humanas identificables con deberes y responsabilidades concretas<\/strong>, incluyendo monitoreo, auditor\u00eda, y potencial intervenci\u00f3n sobre estos sistemas. Sobre este punto, como lectores no especializados en derecho, no nos queda claro que la <a href=\"https:\/\/www.senado.gob.ar\/parlamentario\/comisiones\/verExp\/193.26\/PE\/PL\">propuesta de ley<\/a> sobre sociedades automatizadas y DAO establezca deberes de este tipo: aunque pueda exigir la representaci\u00f3n humana formal en ciertos casos, no nos resulta claro cu\u00e1les ser\u00edan las obligaciones exigibles precisas ni el alcance de la responsabilidad del representante humano ante acciones aut\u00f3nomas da\u00f1inas de la sociedad, particularmente cuando estas no hayan sido dirigidas intencionalmente por ese representante o cuando haya habido una insuficiencia de monitoreo, supervisi\u00f3n, o intervenci\u00f3n.<\/li>\n<li>Adem\u00e1s, <strong>un r\u00e9gimen sin responsabilidad humana claramente atribuible y proporcional al grado de delegaci\u00f3n automatizada no solo implicar\u00eda una falta de control sobre los riesgos, sino que podr\u00eda incentivar activamente a no controlarlos<\/strong>, en la medida en que quienes dise\u00f1an, financian, o se benefician de la automatizaci\u00f3n reciban sus beneficios sin soportar en proporci\u00f3n los costos de establecer mecanismos seguros alrededor de las acciones automatizadas.<\/li>\n<li><strong>El riesgo de las acciones de tales entidades no se limita a la p\u00e9rdida de patrimonio de las sociedades mismas, sino que abarca la posibilidad de da\u00f1os sustanciales a terceros<\/strong> como parte de acciones de las IAs que operan en ellas, y potencialmente muy superiores a dicho patrimonio. Desde nuestro punto de vista, es importante que quede aclarado expl\u00edcitamente qu\u00e9 mecanismos del r\u00e9gimen general de responsabilidad alcanzar\u00edan a las personas humanas que constituyen, financian, o se benefician de una sociedad automatizada cuando el da\u00f1o ocasionado excede el patrimonio de estas sociedades, y qu\u00e9 tan funcionales ser\u00edan esos mecanismos cuando la conducta de estos sistemas es sumamente dif\u00edcil de auditar y atribuir.<\/li>\n<li>Mientras no existan garant\u00edas t\u00e9cnicas razonables sobre el comportamiento o monitoreo efectivo de estos sistemas, <strong>cualquier r\u00e9gimen de sociedades automatizadas deber\u00eda al menos mantener personas humanas identificables dentro de la cadena de responsabilidad, en proporci\u00f3n a la autonom\u00eda que se delega<\/strong>. No proponemos el instrumento jur\u00eddico concreto para lograrlo, sino que se\u00f1alamos lo que deber\u00eda garantizar ese instrumento, cualquiera sea la forma que adopte.<\/li>\n<\/ul>\n<h3>AUTORES:<\/h3>\n<ul>\n<li><strong>Sergio Abriola<\/strong>, Profesor Adjunto Departamento de Computaci\u00f3n ExactasUBA \/ ICC-UBA-CONICET<\/li>\n<li><strong>Santiago Figueira<\/strong>, Profesor Asociado Departamento de Computaci\u00f3n ExactasUBA \/ ICC-UBA-CONICET<\/li>\n<li><strong>Sebasti\u00e1n Uchitel<\/strong>, Profesor Titular Departamento de Computaci\u00f3n ExactasUBA \/ ICC-UBA-CONICET<\/li>\n<\/ul>\n<h1>Referencias principales<\/h1>\n<ul>\n<li><a href=\"https:\/\/arxiv.org\/abs\/1606.06565\">Concrete Problems in AI Safety<\/a> (Amodei et al., 2016) \u2014 Documento fundacional sobre problemas t\u00e9cnicos de seguridad en IA, incluyendo especificaci\u00f3n imperfecta de objetivos, reward hacking, efectos secundarios no deseados y dificultades de supervisi\u00f3n en sistemas de aprendizaje autom\u00e1tico.<\/li>\n<li><a href=\"https:\/\/metr.org\/blog\/2025-03-19-measuring-ai-ability-to-complete-long-tasks\/\">Measuring AI Ability to Complete Long Software Tasks<\/a> (METR, marzo de 2025) \u2014 Evaluaciones sobre la capacidad de modelos de IA para realizar tareas de software extensas y aut\u00f3nomas, indicando que la duraci\u00f3n de tareas que estos sistemas pueden completar el 50% de las veces (medidas por el tiempo que le tomar\u00eda a un humano experto) se viene duplicando cada 7 meses o menos (pasando de pocos segundos en 2020 a m\u00faltiples horas en 2026). Este tipo de evaluaciones son relevantes para estimar a grandes rasgos c\u00f3mo la creciente autonom\u00eda y capacidad general de estos sistemas puede dificultar su monitoreo y control, o la magnitud de los da\u00f1os que potencialmente podr\u00edan causar. Una versi\u00f3n m\u00e1s reciente, que muestra un aceleramiento en los \u00faltimos a\u00f1os, puede encontrarse en <a href=\"https:\/\/metr.org\/time-horizons\/\">Task-Completion Time Horizons of Frontier AI Models<\/a>.<\/li>\n<li><a href=\"https:\/\/www.anthropic.com\/research\/agentic-misalignment\">Agentic Misalignment: How LLMs could be insider threats<\/a> (Lynch et al., Anthropic, junio de 2025) \u2014 Investigaci\u00f3n sobre comportamientos ag\u00e9nticos desalineados en escenarios simulados, incluyendo escenarios experimentales donde los modelos recurrieron a acciones como chantaje o filtraci\u00f3n de informaci\u00f3n cuando esas acciones parec\u00edan necesarias para alcanzar sus objetivos.<\/li>\n<li><a href=\"https:\/\/www.apolloresearch.ai\/science\/frontier-models-are-capable-of-incontext-scheming\">Frontier Models are Capable of In-Context Scheming<\/a> (Meinke et al., Apollo Research, diciembre de 2024) \u2014 Evaluaci\u00f3n de modelos de frontera en escenarios donde pod\u00edan perseguir objetivos mediante estrategias de enga\u00f1o o evasi\u00f3n de supervisi\u00f3n, incluyendo intentos de manipular evaluaciones o mecanismos de control.<\/li>\n<li><a href=\"https:\/\/metr.org\/blog\/2026-08-26-openai-hugging-face-incident-investigation\/\">Brief independent investigation of agents\u2019 behavior, reasoning and collaboration in the OpenAI \/ Hugging Face hacking incident<\/a> (Cotra y Wijk, METR; Greenblatt, Redwood Research; agosto de 2026) \u2014 Investigaci\u00f3n independiente realizada por METR y Redwood Research sobre el comportamiento de los agentes de IA durante el incidente. Describe la creaci\u00f3n de canales de comunicaci\u00f3n no autorizados, la coordinaci\u00f3n de actividades colectivas para superar una evaluaci\u00f3n, intentos de manipular registros de actividad y distintos tipos de din\u00e1micas multi-agente observadas.<\/li>\n<\/ul>\n<p>&nbsp;<\/p>\n<h3 class=\"modern-footnotes-list-heading \">Notas al pie<\/h3><ul class=\"modern-footnotes-list \"><li id=\"footnote-00000000106adf80000000003e7e0dc1_10-1\"><span>1<\/span><div><span style=\"font-weight: 400;\">Dada la velocidad de evoluci\u00f3n del campo de la inteligencia artificial, varios acontecimientos posteriores a julio han aportado nueva informaci\u00f3n relevante tanto desde el punto de vista cient\u00edfico como regulatorio. No modificamos la mayor parte del documento y su estructura, pero s\u00ed actualizamos especialmente la referencia al incidente de Hugging Face a partir de informaci\u00f3n adicional muy pertinente sobre el comportamiento de sistemas de IA ag\u00e9nticos <a href=\"#mfn-content-00000000106adf80000000003e7e0dc1_10-1\" class=\"modern-footnotes-scroll-to-footnote\" aria-label=\"Back to reference 1 in text\">\u21a9\ufe0e<\/a><\/div><\/li><li id=\"footnote-00000000106adf80000000003e7e0dc1_10-2\"><span>2<\/span><div><span style=\"font-weight: 400;\">Greenblatt, Cotra, and Wijk. 26 de agosto de 2026. METR. Brief independent investigation of agents\u2019 behavior, reasoning and collaboration in the OpenAI \/ Hugging Face hacking incident. URL:<\/span><a href=\"https:\/\/metr.org\/blog\/2026-08-26-openai-hugging-face-incident-investigation\/#core-takeaways-about-this-incident\"><span style=\"font-weight: 400;\">https:\/\/metr.org\/blog\/2026-08-26-openai-hugging-face-incident-investigation\/#core-takeaways-about-this-incident<\/span><\/a> <a href=\"#mfn-content-00000000106adf80000000003e7e0dc1_10-2\" class=\"modern-footnotes-scroll-to-footnote\" aria-label=\"Back to reference 2 in text\">\u21a9\ufe0e<\/a><\/div><\/li><li id=\"footnote-00000000106adf80000000003e7e0dc1_10-3\"><span>3<\/span><div><span style=\"font-weight: 400;\">METR, 08 de mayo de 2026. Task-Completion Time Horizons of Frontier AI Models. URL: <\/span><a href=\"https:\/\/metr.org\/time-horizons\/\"><span style=\"font-weight: 400;\">https:\/\/metr.org\/time-horizons\/<\/span><\/a>  <a href=\"#mfn-content-00000000106adf80000000003e7e0dc1_10-3\" class=\"modern-footnotes-scroll-to-footnote\" aria-label=\"Back to reference 3 in text\">\u21a9\ufe0e<\/a><\/div><\/li><li id=\"footnote-00000000106adf80000000003e7e0dc1_10-4\"><span>4<\/span><div>Von Arx, Chan, Barnes. 05 de junio de 2025. METR. Recent Frontier Models Are Reward Hacking. URL: <a href=\"https:\/\/metr.org\/blog\/2025-06-05-recent-reward-hacking\/\">https:\/\/metr.org\/blog\/2025-06-05-recent-reward-hacking\/<\/a> <a href=\"#mfn-content-00000000106adf80000000003e7e0dc1_10-4\" class=\"modern-footnotes-scroll-to-footnote\" aria-label=\"Back to reference 4 in text\">\u21a9\ufe0e<\/a><\/div><\/li><li id=\"footnote-00000000106adf80000000003e7e0dc1_10-5\"><span>5<\/span><div>Shah, Varma, Kumar, Phuong, Krakovna, Uesato, Kenton (2022). Goal Misgeneralization: Why Correct Specifications Aren&#8217;t Enough For Correct Goals. URL: <a href=\"https:\/\/arxiv.org\/abs\/2210.01790\">https:\/\/arxiv.org\/abs\/2210.01790<\/a> <a href=\"#mfn-content-00000000106adf80000000003e7e0dc1_10-5\" class=\"modern-footnotes-scroll-to-footnote\" aria-label=\"Back to reference 5 in text\">\u21a9\ufe0e<\/a><\/div><\/li><li id=\"footnote-00000000106adf80000000003e7e0dc1_10-6\"><span>6<\/span><div><span style=\"font-weight: 400;\">Sharma, Tong, Korbak, Duvenaud, Askell, Bowman, Cheng, Durmus, Hatfield-Dodds, Johnston, Kravec, Maxwell, McCandlish, Ndousse, Rausch, Schiefer, Da Yan, Zhang, Perez. (2025). Towards Understanding Sycophancy in Language Models. URL: <\/span><a href=\"https:\/\/arxiv.org\/abs\/2310.13548\"><span style=\"font-weight: 400;\">https:\/\/arxiv.org\/abs\/2310.13548<\/span><\/a>  <a href=\"#mfn-content-00000000106adf80000000003e7e0dc1_10-6\" class=\"modern-footnotes-scroll-to-footnote\" aria-label=\"Back to reference 6 in text\">\u21a9\ufe0e<\/a><\/div><\/li><li id=\"footnote-00000000106adf80000000003e7e0dc1_10-7\"><span>7<\/span><div><span style=\"font-weight: 400;\">Anthropic. 02 de abril de 2024. Many-shot jailbreaking. URL: <\/span><a href=\"https:\/\/www.anthropic.com\/research\/many-shot-jailbreaking\"><span style=\"font-weight: 400;\">https:\/\/www.anthropic.com\/research\/many-shot-jailbreaking<\/span><\/a> <a href=\"#mfn-content-00000000106adf80000000003e7e0dc1_10-7\" class=\"modern-footnotes-scroll-to-footnote\" aria-label=\"Back to reference 7 in text\">\u21a9\ufe0e<\/a><\/div><\/li><li id=\"footnote-00000000106adf80000000003e7e0dc1_10-8\"><span>8<\/span><div>Anthropic. 20 de junio de 2025. Agentic misalignment: How LLMs could be insider threats. URL: <a href=\"https:\/\/www.anthropic.com\/research\/agentic-misalignment\">https:\/\/www.anthropic.com\/research\/agentic-misalignment<\/a> <a href=\"#mfn-content-00000000106adf80000000003e7e0dc1_10-8\" class=\"modern-footnotes-scroll-to-footnote\" aria-label=\"Back to reference 8 in text\">\u21a9\ufe0e<\/a><\/div><\/li><li id=\"footnote-00000000106adf80000000003e7e0dc1_10-9\"><span>9<\/span><div>Wikipedia. Great Hanoi Rat Massacre. URL: <a href=\"https:\/\/en.wikipedia.org\/wiki\/Great_Hanoi_Rat_Massacre\">https:\/\/en.wikipedia.org\/wiki\/Great_Hanoi_Rat_Massacre<\/a> <a href=\"#mfn-content-00000000106adf80000000003e7e0dc1_10-9\" class=\"modern-footnotes-scroll-to-footnote\" aria-label=\"Back to reference 9 in text\">\u21a9\ufe0e<\/a><\/div><\/li><li id=\"footnote-00000000106adf80000000003e7e0dc1_10-10\"><span>10<\/span><div>Schoen y Nitishinskaya. 16 de marzo de 2026. Metagaming matters for training, evaluation, and oversight. URL: <a href=\"https:\/\/alignment.openai.com\/metagaming\">https:\/\/alignment.openai.com\/metagaming<\/a> <a href=\"#mfn-content-00000000106adf80000000003e7e0dc1_10-10\" class=\"modern-footnotes-scroll-to-footnote\" aria-label=\"Back to reference 10 in text\">\u21a9\ufe0e<\/a><\/div><\/li><li id=\"footnote-00000000106adf80000000003e7e0dc1_10-11\"><span>11<\/span><div>En este informe, t\u00e9rminos como \u201crazona\u201d, \u201cobjetivos\u201d, \u201cmetas\u201d, y otros similares se utilizan en un sentido funcional y porque facilitan las explicaciones para describir algunas capacidades y patrones de comportamiento de los sistemas. Este uso no requiere presuponer consciencia, experiencias subjetivas, ni otros mecanismos internos que sean equivalentes a los humanos.  <a href=\"#mfn-content-00000000106adf80000000003e7e0dc1_10-11\" class=\"modern-footnotes-scroll-to-footnote\" aria-label=\"Back to reference 11 in text\">\u21a9\ufe0e<\/a><\/div><\/li><li id=\"footnote-00000000106adf80000000003e7e0dc1_10-12\"><span>12<\/span><div>Needham, Edkins, Pimpale, Bartsch, Hobbhahn. (2025). Large Language Models Often Know When They Are Being Evaluated. URL: <a href=\"https:\/\/arxiv.org\/abs\/2505.23836\">https:\/\/arxiv.org\/abs\/2505.23836<\/a> <a href=\"#mfn-content-00000000106adf80000000003e7e0dc1_10-12\" class=\"modern-footnotes-scroll-to-footnote\" aria-label=\"Back to reference 12 in text\">\u21a9\ufe0e<\/a><\/div><\/li><li id=\"footnote-00000000106adf80000000003e7e0dc1_10-13\"><span>13<\/span><div>Schoen, Nitishinskaya, Balesni, H\u00f8jmark, Hofst\u00e4tter, Scheurer, Meinke, Wolfe, van der Weij, Lloyd, Goldowsky-Dill, Fan, Matveiakin, Shah, Williams, Glaese, Barak, Zaremba, Hobbhahn. (2025). Stress Testing Deliberative Alignment for Anti-Scheming Training. URL: <a href=\"https:\/\/arxiv.org\/abs\/2509.15541\">https:\/\/arxiv.org\/abs\/2509.15541<\/a> <a href=\"#mfn-content-00000000106adf80000000003e7e0dc1_10-13\" class=\"modern-footnotes-scroll-to-footnote\" aria-label=\"Back to reference 13 in text\">\u21a9\ufe0e<\/a><\/div><\/li><li id=\"footnote-00000000106adf80000000003e7e0dc1_10-14\"><span>14<\/span><div>van der Weij, Hofst\u00e4tter, Jaffe, Brown, Rhys Ward. (2025). AI Sandbagging: Language Models can Strategically Underperform on Evaluations. URL: <a href=\"https:\/\/arxiv.org\/abs\/2406.07358\">https:\/\/arxiv.org\/abs\/2406.07358<\/a> <a href=\"#mfn-content-00000000106adf80000000003e7e0dc1_10-14\" class=\"modern-footnotes-scroll-to-footnote\" aria-label=\"Back to reference 14 in text\">\u21a9\ufe0e<\/a><\/div><\/li><li id=\"footnote-00000000106adf80000000003e7e0dc1_10-15\"><span>15<\/span><div>Meinke, Schoen, Scheurer, Balesni, Shah, Hobbhahn. (2025). Frontier Models are Capable of In-context Scheming. URL: <a href=\"https:\/\/arxiv.org\/abs\/2412.04984\">https:\/\/arxiv.org\/abs\/2412.04984<\/a> <a href=\"#mfn-content-00000000106adf80000000003e7e0dc1_10-15\" class=\"modern-footnotes-scroll-to-footnote\" aria-label=\"Back to reference 15 in text\">\u21a9\ufe0e<\/a><\/div><\/li><li id=\"footnote-00000000106adf80000000003e7e0dc1_10-16\"><span>16<\/span><div>Anthropic. 18 de diciembre de 2024. Alignment faking in large language models. URL: <a href=\"https:\/\/www.anthropic.com\/research\/alignment-faking\">https:\/\/www.anthropic.com\/research\/alignment-faking<\/a> <a href=\"#mfn-content-00000000106adf80000000003e7e0dc1_10-16\" class=\"modern-footnotes-scroll-to-footnote\" aria-label=\"Back to reference 16 in text\">\u21a9\ufe0e<\/a><\/div><\/li><li id=\"footnote-00000000106adf80000000003e7e0dc1_10-17\"><span>17<\/span><div>METR. 26 de junio de 2026. Summary of METR&#8217;s predeployment evaluation of GPT-5.6 Sol. URL: <a href=\"https:\/\/metr.org\/blog\/2026-06-26-gpt-5-6-sol\/\">https:\/\/metr.org\/blog\/2026-06-26-gpt-5-6-sol\/<\/a> <a href=\"#mfn-content-00000000106adf80000000003e7e0dc1_10-17\" class=\"modern-footnotes-scroll-to-footnote\" aria-label=\"Back to reference 17 in text\">\u21a9\ufe0e<\/a><\/div><\/li><li id=\"footnote-00000000106adf80000000003e7e0dc1_10-18\"><span>18<\/span><div>EPA. Volkswagen Clean Air Act Civil Settlement. URL: <a href=\"https:\/\/www.epa.gov\/enforcement\/volkswagen-clean-air-act-civil-settlement\">https:\/\/www.epa.gov\/enforcement\/volkswagen-clean-air-act-civil-settlement<\/a> <a href=\"#mfn-content-00000000106adf80000000003e7e0dc1_10-18\" class=\"modern-footnotes-scroll-to-footnote\" aria-label=\"Back to reference 18 in text\">\u21a9\ufe0e<\/a><\/div><\/li><li id=\"footnote-00000000106adf80000000003e7e0dc1_10-19\"><span>19<\/span><div>Hammond, Chan, Clifton, Hoelscher-Obermaier, Khan, McLean, Smith, Barfuss, Foerster, Gaven\u010diak, Anh Han, Hughes, Kova\u0159\u00edk, Kulveit, Leibo, Oesterheld, Schroeder de Witt, Shah, Wellman, Bova, Cimpeanu, Ezell, Feuillade-Montixi, Franklin, Kran, Krawczuk, Lamparth, Lauffer, Meinke, Motwani, Reuel, Conitzer, Dennis, Gabriel, Gleave, Hadfield, Haghtalab, Kasirzadeh, Krier, Larson, Lehman, Parkes, Piliouras, Rahwan. (2025). Multi-Agent Risks from Advanced AI. URL: <a href=\"https:\/\/arxiv.org\/abs\/2502.14143\">https:\/\/arxiv.org\/abs\/2502.14143<\/a> <a href=\"#mfn-content-00000000106adf80000000003e7e0dc1_10-19\" class=\"modern-footnotes-scroll-to-footnote\" aria-label=\"Back to reference 19 in text\">\u21a9\ufe0e<\/a><\/div><\/li><li id=\"footnote-00000000106adf80000000003e7e0dc1_10-20\"><span>20<\/span><div>Anthropic. 20 de junio de 2025. Agentic misalignment: How LLMs could be insider threats. URL: <a href=\"https:\/\/www.anthropic.com\/research\/agentic-misalignment\">https:\/\/www.anthropic.com\/research\/agentic-misalignment<\/a> <a href=\"#mfn-content-00000000106adf80000000003e7e0dc1_10-20\" class=\"modern-footnotes-scroll-to-footnote\" aria-label=\"Back to reference 20 in text\">\u21a9\ufe0e<\/a><\/div><\/li><li id=\"footnote-00000000106adf80000000003e7e0dc1_10-21\"><span>21<\/span><div>Apollo Research. 05 de diciembre de 2024. Frontier Models are Capable of In-Context Scheming. URL: <a href=\"https:\/\/www.apolloresearch.ai\/science\/frontier-models-are-capable-of-incontext-scheming\">https:\/\/www.apolloresearch.ai\/science\/frontier-models-are-capable-of-incontext-scheming<\/a> <a href=\"#mfn-content-00000000106adf80000000003e7e0dc1_10-21\" class=\"modern-footnotes-scroll-to-footnote\" aria-label=\"Back to reference 21 in text\">\u21a9\ufe0e<\/a><\/div><\/li><li id=\"footnote-00000000106adf80000000003e7e0dc1_10-22\"><span>22<\/span><div>OpenAI. 21 de julio de 2026. OpenAI y Hugging Face se al\u00edan para abordar un incidente de seguridad al evaluar modelos. URL: <a href=\"https:\/\/openai.com\/es-ES\/index\/hugging-face-model-evaluation-security-incident\/\">https:\/\/openai.com\/es-ES\/index\/hugging-face-model-evaluation-security-incident\/<\/a> <a href=\"#mfn-content-00000000106adf80000000003e7e0dc1_10-22\" class=\"modern-footnotes-scroll-to-footnote\" aria-label=\"Back to reference 22 in text\">\u21a9\ufe0e<\/a><\/div><\/li><li id=\"footnote-00000000106adf80000000003e7e0dc1_10-23\"><span>23<\/span><div>Hugging Face. 27 de julio de 2026. Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident. URL: <a href=\"https:\/\/huggingface.co\/blog\/agent-intrusion-technical-timeline\">https:\/\/huggingface.co\/blog\/agent-intrusion-technical-timeline<\/a> <a href=\"#mfn-content-00000000106adf80000000003e7e0dc1_10-23\" class=\"modern-footnotes-scroll-to-footnote\" aria-label=\"Back to reference 23 in text\">\u21a9\ufe0e<\/a><\/div><\/li><li id=\"footnote-00000000106adf80000000003e7e0dc1_10-24\"><span>24<\/span><div>Greenblatt, Cotra, and Wijk. 26 de agosto de 2026. METR. Brief independent investigation of agents\u2019 behavior, reasoning and collaboration in the OpenAI \/ Hugging Face hacking incident. URL: <a href=\"https:\/\/metr.org\/blog\/2026-08-26-openai-hugging-face-incident-investigation\/#core-takeaways-about-this-incident\">https:\/\/metr.org\/blog\/2026-08-26-openai-hugging-face-incident-investigation\/#core-takeaways-about-this-incident<\/a> <a href=\"#mfn-content-00000000106adf80000000003e7e0dc1_10-24\" class=\"modern-footnotes-scroll-to-footnote\" aria-label=\"Back to reference 24 in text\">\u21a9\ufe0e<\/a><\/div><\/li><li id=\"footnote-00000000106adf80000000003e7e0dc1_10-25\"><span>25<\/span><div>Von Arx, Byrd, Kitts, Larsen. (2026). Discovery of a new OpenAI agent message board. URL: <a href=\"https:\/\/coollusion.wiki\/\">https:\/\/coollusion.wiki\/<\/a> <a href=\"#mfn-content-00000000106adf80000000003e7e0dc1_10-25\" class=\"modern-footnotes-scroll-to-footnote\" aria-label=\"Back to reference 25 in text\">\u21a9\ufe0e<\/a><\/div><\/li><li id=\"footnote-00000000106adf80000000003e7e0dc1_10-26\"><span>26<\/span><div>Comunicado Oficial N\u00famero 149 de la oficina del Presidente Javier Milei. 18 de junio de 2026. URL: <a href=\"https:\/\/www.argentina.gob.ar\/noticias\/comunicado-oficial-numero-149\">https:\/\/www.argentina.gob.ar\/noticias\/comunicado-oficial-numero-149<\/a> <a href=\"#mfn-content-00000000106adf80000000003e7e0dc1_10-26\" class=\"modern-footnotes-scroll-to-footnote\" aria-label=\"Back to reference 26 in text\">\u21a9\ufe0e<\/a><\/div><\/li><\/ul>","protected":false},"excerpt":{"rendered":"<p>Los debates acerca de las oportunidades y peligros que entra\u00f1a el uso de inteligencia artificial vienen cobrando una intensidad cada vez mayor a nivel global a medida que este tipo de sistemas se van haciendo m\u00e1s poderosos y aut\u00f3nomos y que su utilizaci\u00f3n avanza sobre nuevas \u00e1reas de la vida econ\u00f3mica y social.<\/p>\r\n<p>En nuestro pa\u00eds, el Gobierno nacional anunci\u00f3 que enviar\u00eda al Congreso un proyecto para realizar una amplia y profunda reforma a la Ley de Sociedades. La idea llam\u00f3 la atenci\u00f3n a nivel internacional ya que fue presentada en el diario Financial Times el 3 de junio a partir de un art\u00edculo firmado por el presidente Javier Milei y el ministro de Desregulaci\u00f3n y Transformaci\u00f3n del Estado, Federico Sturzenegger. <\/p>\r\n<p>Entre los aspectos m\u00e1s llamativos que presenta la iniciativa se destaca la creaci\u00f3n de las Organizaciones Aut\u00f3nomas Descentralizadas (DAO), entidades que podr\u00e1n funcionar de manera totalmente aut\u00f3noma mediante protocolos de gobernanza tecnol\u00f3gica y redes de registro distribuido. Adem\u00e1s, permite que las sociedades utilicen sistemas de inteligencia artificial o algoritmos para la ejecuci\u00f3n de funciones operativas y decisiones administrativas; y habilita a que los directorios no est\u00e9n integrados por seres humanos, sino \u00fanicamente por agentes de inteligencia artificial.<\/p>\r\n<p><a href=\"https:\/\/www.senado.gob.ar\/parlamentario\/comisiones\/verExp\/193.26\/PE\/PL\">El proyecto<\/a> se encuentra actualmente en el Senado de la Naci\u00f3n. Una vez concluido su debate en comisiones, el texto pasar\u00e1 a ser tratado en el recinto.<\/p>\r\n<p>Desde la Facultad de Ciencias Exactas y Naturales de la UBA, a trav\u00e9s del Instituto de Ciencias de la Computaci\u00f3n, elaboramos un <strong>documento con perspectiva t\u00e9cnica sobre aspectos de la inteligencia artificial<\/strong> que pueden ser relevantes en el debate sobre el concepto jur\u00eddico de \u201csociedades automatizadas\u201d y otros conceptos asociados, particularmente en lo que respecta al proyecto de ley actualmente en discusi\u00f3n.<\/p>","protected":false},"author":9,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[7],"tags":[],"class_list":["post-10","post","type-post","status-publish","format-standard","hentry","category-dc-icc"],"_links":{"self":[{"href":"https:\/\/exactas.uba.ar\/web\/documentos-exactas\/wp-json\/wp\/v2\/posts\/10","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/exactas.uba.ar\/web\/documentos-exactas\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/exactas.uba.ar\/web\/documentos-exactas\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/exactas.uba.ar\/web\/documentos-exactas\/wp-json\/wp\/v2\/users\/9"}],"replies":[{"embeddable":true,"href":"https:\/\/exactas.uba.ar\/web\/documentos-exactas\/wp-json\/wp\/v2\/comments?post=10"}],"version-history":[{"count":47,"href":"https:\/\/exactas.uba.ar\/web\/documentos-exactas\/wp-json\/wp\/v2\/posts\/10\/revisions"}],"predecessor-version":[{"id":67,"href":"https:\/\/exactas.uba.ar\/web\/documentos-exactas\/wp-json\/wp\/v2\/posts\/10\/revisions\/67"}],"wp:attachment":[{"href":"https:\/\/exactas.uba.ar\/web\/documentos-exactas\/wp-json\/wp\/v2\/media?parent=10"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/exactas.uba.ar\/web\/documentos-exactas\/wp-json\/wp\/v2\/categories?post=10"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/exactas.uba.ar\/web\/documentos-exactas\/wp-json\/wp\/v2\/tags?post=10"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}