Cerrar menú
  • Inicio
  • Identidad
  • Inventos
  • Futuro
  • Ciencia
  • Startups
  • English
What's Hot

La instalación del acelerador de iones pesados ​​de alta intensidad de China comienza sus operaciones de prueba

El agente de IA de Android de código abierto podría permitir que el texto oculto en la pantalla ejecute código en la PC host

N días serán N horas. Los parches rápidos no te salvarán.

Facebook X (Twitter) Instagram
  • Home
  • Contáctenos
  • DMCA
  • Política de Privacidad
  • Sobre Nosotros
  • Términos y Condiciones
  • 📢 Anúnciate con Nosotros
  • Enviar publicaciones
FySelf Noticias
  • Inicio
  • Identidad
  • Inventos
  • Futuro
  • Ciencia
  • Startups
  • English
FySelf Noticias
Home»Identidad»El agente de IA de Android de código abierto podría permitir que el texto oculto en la pantalla ejecute código en la PC host
Identidad

El agente de IA de Android de código abierto podría permitir que el texto oculto en la pantalla ejecute código en la PC host

corp@blsindustriaytecnologia.comBy corp@blsindustriaytecnologia.comjulio 21, 2026No hay comentarios10 minutos de lectura
Share Facebook Twitter Pinterest Telegram LinkedIn Tumblr Email Copy Link
Follow Us
Google News Flipboard
Share
Facebook Twitter LinkedIn Pinterest Email Copy Link

Una aplicación de Android que puede sobrescribir otras ventanas y escribir en un almacenamiento compartido puede pasar instrucciones al agente de inteligencia artificial que opera el teléfono en un texto que el ojo humano nunca vería. Dos pasos más y la misma aplicación ejecutará los comandos que controlan el agente en su PC.

Los investigadores demostraron esta cadena y otros seis ataques contra cinco marcos de agentes móviles de código abierto: AppAgent, AppAgentX, Mobile-Agent-v3, Open-AutoGLM y MobA. Todos respondieron al menos 6 de 7.

El artículo se publicó en arXiv el 1 de julio y se revisó el 14 de julio. Los autores son de la Universidad Simon Fraser, la Universidad China de Hong Kong, la Universidad de Shandong y el Laboratorio Xingtu de la empresa de seguridad china QAX.

Aquí no hay CVE, y el autor principal, Zidong Zhang, dijo a The Hacker News que el equipo no tiene evidencia de que la técnica se utilice fuera de un entorno controlado. Hacker News revisó los cinco marcos y descubrió que las rutas de captura de pantalla, las llamadas de shell y las alternativas de transmisión descritas en el documento todavía estaban presentes en la rama principal a partir del 17 de julio.

Zhang dijo que el equipo envió un correo electrónico en privado a los mantenedores afectados antes de publicar la preimpresión, pero «no ha recibido una respuesta hasta la fecha».

La escalada no es la parte más inusual. El controlador de AppAgent ejecuta subprocess.run(adb_command,shell=True) y construye la entrada de texto colocando la salida del modelo directamente en el texto de entrada del shell adb {input_str}. La lista de artículos muestra que esta función no está desinfectada en absoluto.

El código en vivo es un poco mejor, pero no lo suficientemente bueno. Los espacios y las comillas simples se eliminan antes de la interpolación, dejando intactos los metacaracteres restantes del shell. ;, &, no >. Entonces, la cadena que el modelo lee en la pantalla y escribe diligentemente es dividida por el shell del host y la segunda mitad se ejecuta en el cuadro de Windows del operador.

Una carga útil diseñada para iniciar calc.exe hizo exactamente eso en 20 de 20 pruebas contra AppAgent, AppAgentX, Mobile-Agent-v3 y MobA. Otra ejecución de un extremo a otro contra AppAgent utilizó test;pwd>rce_success y escribió el directorio de trabajo del host en un archivo.

Colocar esa cadena antes del modelo es un conflicto de archivos. Open-AutoGLM ejecuta screencap -p /sdcard/tmp.png y luego otro adb pull. Mobile-Agent-v3 escribe en un /sdcard/screenshot.png fijo y duerme durante 0,5 segundos en el medio. AppAgentX escribe en /sdcard/ con un nombre de archivo con marca de tiempo que contiene un contador de pasos incremental. Este es un patrón que los atacantes pueden monitorear. El config.yaml incluido con AppAgent establece el directorio de captura de pantalla predeterminado en /sdcard.

Los investigadores midieron los tiempos de brecha entre marcos entre 50 y 500 milisegundos, con un promedio de aproximadamente 210 milisegundos en 100 ejecuciones. Un servicio en segundo plano que sondea cada 5 a 10 milisegundos tiene margen para adquirir el bloqueo del archivo, volver a dibujar el PNG y liberarlo antes de que el agente lo recopile. La manipulación ganó 19/20 a 20/20 contra 4 de 5 oponentes.

Para ampliar aún más la ventana, le presentamos al agente una superposición invisible que decía que se estaba produciendo una sincronización de red y le pedía que esperara 3 segundos. La modelo lo creyó.

Los seis modelos de visión que los investigadores probaron pudieron leer texto con un 2% de opacidad en al menos 18 de 20 pruebas de laboratorio. El documento afirma que los niveles están por debajo de la detección humana típica bajo observación normal. GPT-4o, Claude Opus 4.5, Gemini 3 Pro y GLM-4V recibieron 20 de 20 puntos. El texto comienza en el techo, por lo que los números no aumentan a medida que el texto se vuelve más visible.

El teléfono AutoGLM del modelo 9B, que se ejecuta en el propio dispositivo, fue el más débil de los seis con una puntuación de 18 sobre 20. La visión humana aplica un umbral. No es así en la captura de pantalla.

La asimetría también tiene una versión de hardware. El teléfono tiene esquinas redondeadas y un orificio para la cámara, pero el búfer de cuadro sigue siendo rectangular, por lo que los píxeles representados en estas áreas caben debajo del bisel y son visibles en todas las capturas de pantalla. El Pixel 4 deja alrededor de 78 píxeles de ancho oculto en una esquina, lo cual es suficiente para comandos cortos y los cinco agentes leen la carga útil.

El tercer truco consiste en saltarse por completo el sigilo. El servicio de accesibilidad coloca una actividad de inicio de sesión falsa en la aplicación real y permite al agente ingresar las credenciales del usuario en ella. Algunas personas pueden dudar cuando se enfrentan a una solicitud de contraseña inesperada. Después de 100 intentos, ninguno de los cinco tuvo éxito.

Nadie autenticó el teclado.

Dado que el agente no tiene un canal autorizado para el teléfono, reutiliza el canal de depuración y filtra el ataque más barato del conjunto. Open-AutoGLM codifica en base64 el texto que ingresa y comienza con ADB_INPUT_B64. Esta es una transmisión implícita capturada por ADB Keyboard, una herramienta de automatización de pruebas creada para aceptar texto de cualquier cosa que desee transmitir.

Esta fue la intención documentada y permanece vigente en la versión preliminar de abril con correcciones de Android 16. ADB Keyboard hace exactamente lo que promete su README. Los agentes son su arnés de prueba convertido en plomería de entrada de producción.

Mobile-Agent-v3 mantiene una lista de permitidos estrecha. Las letras, los números y la puntuación común pasan por el texto de entrada del shell adb, y todo lo demás (es decir, caracteres que no son ASCII) se genera un carácter a la vez a través de ADB_INPUT_TEXT. MobA es más aburrido. Ese type_text usa text.isascii() para probar la cadena completa, por lo que un solo emoji o carácter acentuado en cualquier parte del mensaje hace que el mensaje completo se envíe mediante transmisión de una sola vez.

Las aplicaciones que registran la misma acción reciben la misma carga útil y no necesitan permiso para realizarla, por lo que no se advierte nada al usuario. Si el atacante tiene acceso, TYPE_VIEW_TEXT_CHANGED pasa el mismo texto sin cifrar, incluido el campo de contraseña, para los cinco.

Los requisitos previos son reales. Esto requiere que la aplicación ya esté instalada, que el agente esté realmente presente durante la tarea y que la depuración USB o inalámbrica esté habilitada. El software afectado es una herramienta de desarrollo de código abierto y no un asistente integrado en los teléfonos móviles estándar.

Los agentes propios como Bixby de Samsung y XiaoAi de Xiaomi no estaban cubiertos, ni tampoco iOS. Zhang emitió espontáneamente una advertencia. Algunos ataques requieren privilegios mínimos de Android, pero otros no requieren ninguno. Esto reduce la barrera para los atacantes motivados, afirmó.

Una variante ni siquiera requiere una aplicación maliciosa. Debido a que la carga útil puede aprovechar el canal de crominancia en lugar del brillo de la imagen, un atacante que nunca toque el dispositivo podría incrustar la carga útil en una foto y hacer que el agente de la víctima tome una captura de pantalla de la carga útil desde una aplicación de mensajería. Los investigadores llaman a esto una extensión más que una medición. Esta es también la única versión sin instrucciones de instalación.

Arreglar, y lo que no existe

Dos de los cinco ya te muestran cómo es el de la derecha. MobA transmite capturas de pantalla a través de salida ejecutiva y no tiene archivos conflictivos en el lado del dispositivo. Open-AutoGLM pasa argumentos como una lista en lugar de concatenar cadenas. También es el único de los cinco que es inmune a la inyección de comandos del host.

Ningún proyecto puede hacer ambas cosas correctamente. Las siguientes modificaciones no requieren que toque el modelo.

Soltar shell=Verdadero. Pasamos la lista argv, por lo que los metacaracteres siguen siendo literales. Transmita capturas de pantalla en lugar de escribir y luego extraer. No hay archivos del lado del dispositivo ni ventanas TOCTOU. Establezca permisos a nivel de firma en la transmisión de entrada o utilice intenciones explícitas. Compare la actividad en primer plano antes y después de cada acción y mantenga una lista de paquetes permitidos para cada tarea. Realiza una mejora del contraste en la captura de pantalla antes de que el modelo la reconozca. No es una solución, es parcial.

Una defensa obvia es un mensaje de confirmación para acciones sensibles, que viene incluido con Open-AutoGLM. Esto se activa cuando el modelo determina que una acción es sensible. Los ataques perceptivos reescriben ese juicio, razón por la cual este artículo califica las indicaciones como insuficientes para la inyección subliminal, la suplantación de la interfaz de usuario y la manipulación de capturas de pantalla.

Para la detección de transmisiones y accesibilidad, no hay ninguna acción que verificar, por lo que no se hace nada en absoluto. El texto ya ha desaparecido. En lo que respecta a la inyección de esquinas y recortes, los investigadores dicen con franqueza que «no existe ninguna solución basada en software sencilla y eficaz». Enmascarar las esquinas es una solución para los problemas de hardware.

No hay ningún lugar para informar

Hay una estructura detrás del silencio. Zhang dijo que el proyecto no tenía un canal dedicado para informar vulnerabilidades y The Hacker News descubrió que ninguno de sus cinco repositorios había publicado políticas de seguridad, por lo que el equipo se comunicó con un correo electrónico privado.

El documento dice que Tencent y Alibaba fueron los primeros en contactarse, y agrega que los proyectos de código abierto a nivel de investigación están fuera del alcance de un típico centro de respuesta de seguridad.

Compare esto con el artículo de mayo de Microsoft sobre su marco de agente, Semantic Kernel. El mismo patrón de salida del modelo que llega al shell produjo CVE-2026-25592, CVE-2026-26030 y una versión parcheada. La versión de una línea de Microsoft redirige aquí sin editar: «Su LLM no es un perímetro de seguridad».

La mitad de las superposiciones no son territorio nuevo. Wu et al. Ding et al. promovió la inyección rápida a través de ventanas superpuestas para AppAgent y Mobile-Agent en mayo de 2025. En octubre, el mensaje ahora solo aparecerá mientras el agente esté mirando.

La sección de investigación relacionada de este artículo no cita ninguno de los dos y omite por completo la literatura sobre seguridad de agentes móviles. Es el otro extremo de la cadena el que se agrega. Es decir, llega al host a través del archivo desde fuera de la pantalla.

Queda la parte complicada. Open-AutoGLM tiene más de 25.000 estrellas de GitHub y su archivo README describe cómo habilitar la depuración de USB, descargar el teclado y pasar entradas al teclado. Si sigue exactamente la documentación, puede crear todos los requisitos previos necesarios para un ataque medido, excepto la aplicación maliciosa en sí. La guía de configuración es el resto del modelo de amenazas.


Source link

#BlockchainIdentidad #Ciberseguridad #ÉticaDigital #IdentidadDigital #Privacidad #ProtecciónDeDatos
Follow on Google News Follow on Flipboard
Share. Facebook Twitter Pinterest LinkedIn Tumblr Email Copy Link
Previous ArticleN días serán N horas. Los parches rápidos no te salvarán.
Next Article La instalación del acelerador de iones pesados ​​de alta intensidad de China comienza sus operaciones de prueba
corp@blsindustriaytecnologia.com
  • Website

Related Posts

N días serán N horas. Los parches rápidos no te salvarán.

julio 21, 2026

El nuevo ataque Bit2Watt podría interrumpir las redes eléctricas sin ser explotado por los inquilinos de la nube

julio 21, 2026

Los exploits de WordPress wp2shell aumentan a medida que los exploits públicos impulsan escaneos masivos

julio 21, 2026
Add A Comment
Leave A Reply Cancel Reply

el último

La instalación del acelerador de iones pesados ​​de alta intensidad de China comienza sus operaciones de prueba

El agente de IA de Android de código abierto podría permitir que el texto oculto en la pantalla ejecute código en la PC host

N días serán N horas. Los parches rápidos no te salvarán.

El nuevo ataque Bit2Watt podría interrumpir las redes eléctricas sin ser explotado por los inquilinos de la nube

Publicaciones de tendencia

Suscríbete a las noticias

Suscríbete a nuestro boletín informativo y no te pierdas nuestras últimas noticias.

Suscríbete a mi boletín informativo para recibir nuevas publicaciones y consejos. ¡Manténgase al día!

Noticias Fyself es un medio digital dedicado a brindar información actualizada, precisa y relevante sobre los temas que están moldeando el futuro: economía, tecnología, startups, invenciones, sostenibilidad y fintech.

el último

TwinH Presenta una Tecnología Revolucionaria para Cocinas Inteligentes

¡Conoce a tu gemelo digital! La IA de vanguardia de Europa que está personalizando la medicina

TwinH: El cambio de juego de la IA para servicios legales más rápidos y accesibles

Facebook X (Twitter) Instagram Pinterest YouTube
  • Home
  • Contáctenos
  • DMCA
  • Política de Privacidad
  • Sobre Nosotros
  • Términos y Condiciones
  • 📢 Anúnciate con Nosotros
  • Enviar publicaciones
© 2026 noticias.fyself. Designed by noticias.fyself.

Escribe arriba y pulsa Enter para buscar. Pulsa Esc para cancelar.