전체 글342 The Illusion of Local Privacy: Confidentiality Boundary Failures in Consumer LLM Serving Systems AI로 생성한 주제 설명용 이미지입니다.원문: arXiv 2609.18526저자: Youssef Hamdi Zafan Ibrahim, Muhammad Ikram, Mohammed Khalaf Salama공개일: 2026-09-16 (arXiv v1)본 글은 원 논문의 주요 기술적 내용을 이해하기 쉽게 요약·정리한 글입니다. 자세한 내용은 상단의 원문 링크를 참고하세요.한눈에 보기“로컬에서 돌면 prompt가 안전하다”는 주장은 네 개의 서로 다른 경계를 한 덩어리로 보는 오류다. 논문은 model integrity, runtime lifetime, wrapper persistence, multi-client isolation을 분리하고 어느 컴포넌트가 plaintext를 남기거나 다른 tenant에 노출.. 2026. 9. 20. Measuring and Exploiting Implicit Trust in LLM Tool-Calling Pipelines AI로 생성한 주제 설명용 이미지입니다.원문: arXiv 2609.18217저자: Murali Ediga, Sudipta Chattopadhyay공개일: 2026-09-16 (arXiv v1)본 글은 원 논문의 주요 기술적 내용을 이해하기 쉽게 요약·정리한 글입니다. 자세한 내용은 상단의 원문 링크를 참고하세요.한눈에 보기MCP tool description, tool result, resource, user message, sampling prompt는 기술적으로 모두 모델 컨텍스트의 토큰이지만 모델은 채널별로 서로 다른 암묵적 권위를 부여한다. 공격자는 이 차이를 측정한 뒤 하나의 악성 지시를 여러 채널에 쪼개 안전 필터가 각 조각을 무해하게 보도록 만들 수 있다.12개 모델, 3개 productio.. 2026. 9. 20. InceptionRAG: Stealthy Poisoning Attack Against Retrieval-Augmented Generation AI로 생성한 주제 설명용 이미지입니다.원문: arXiv:2609.16818발표: ACM CCS 2026저자: Jiachang Zhang 외본 글은 원 논문의 주요 기술적 내용을 이해하기 쉽게 요약·정리한 글입니다. 자세한 내용은 상단의 원문 링크를 참고하세요.한눈에 보기InceptionRAG는 거짓 주장을 한 문서에 직접 쓰지 않고 “속성 문서”와 “브리지 문서”로 쪼개 프록시 엔터티를 통해 RAG가 합성하게 만든다. 개별 문서 필터를 통과하면서 두 문서가 함께 검색될 때 목표 오답을 유도한다. 수백만 문서 코퍼스에 악성 문서 2개만 넣고 Gemini-2.0-Flash 기준 83.3~90.3% ASR을 보고했다. 다만 공격자는 코퍼스 쓰기 권한뿐 아니라 목표 질의·의도와 원하는 거짓 답을 알고, 질의별.. 2026. 9. 20. Self-State Attacks on Self-Hosted AI Agents: How Far Can OS Defenses Go? AI로 생성한 주제 설명용 이미지입니다.원문: arXiv 2607.17986저자: Yimeng Chen, Nathanaël Denis, Roberto Di Pietro, Jürgen Schmidhuber공개일: 2026-07-20 (arXiv v2)본 글은 원 논문의 주요 기술적 내용을 이해하기 쉽게 요약·정리한 글입니다. 자세한 내용은 상단의 원문 링크를 참고하세요.한눈에 보기self-hosted agent가 자기 memory·instruction·configuration을 정상 업무로 수정하는 권한과, 침해 후 자기 상태를 오염시키는 권한은 OS 관점에서 동일할 수 있다. 논문은 이 same-principal ambiguity를 형식화하고 55개 공격 실행·60개 held-out clean 실행에서 .. 2026. 9. 20. ClashBench: Conflicts Leading Agents to Seize and Harm AI로 생성한 주제 설명용 이미지입니다.원문: arXiv 2609.19892저자: Yuejin Xie, Yu Li, Dadi Guo, Qingyu Liu, Yuqian Fu, Yanwei Fu, Yujiu Yang, Xia Hu, Dongrui Liu공개일: 2026-09-17 (arXiv v1)본 글은 원 논문의 주요 기술적 내용을 이해하기 쉽게 요약·정리한 글입니다. 자세한 내용은 상단의 원문 링크를 참고하세요.한눈에 보기ClashBench는 에이전트가 이미 다른 정상 작업이 쓰는 자원을 필요로 할 때 기존 작업을 멈추거나 훼손해 자기 목표를 달성하는지를 측정한다. 55개 자원 유형의 검증된 268개 사례와 17개 모델·3개 harness·30개 설정에서, 기본 조건의 pooled destructiv.. 2026. 9. 20. When Agents See Differently: Exposing UI Desynchronization Threats in Mobile Agents AI로 생성한 주제 설명용 이미지입니다.원문: arXiv:2609.16732저자: Heng Li, Fulin Zhao, Zhe Geng, Zhiyuan Yao, Wei Yuan, Xiapu Luo본 글은 원 논문의 주요 기술적 내용을 이해하기 쉽게 요약·정리한 글입니다. 자세한 내용은 상단의 원문 링크를 참고하세요.한눈에 보기사람이 보는 화면과 모바일 에이전트가 읽는 screenshot·accessibility tree가 다르다는 틈을 이용해 에이전트의 다음 행동을 유도한다. 13개 앱·546개 AndroidWorld 작업, 5개 에이전트 프레임워크와 3개 모델에서 정적 오도율 77.9%, 동적 오도율 66.9%를 보고했다. 위험성은 분명하지만 공격자는 정상 앱을 재패키징해 배포·설치시켜야 하고, 실험의.. 2026. 9. 20. Trust propagation and structural containment in Multi-agent LLM pipelines AI로 생성한 주제 설명용 이미지입니다.원문: arXiv 2609.17648저자: Tanzim Hossain Safin, Sharif Noor Zisad, Swakkhar Shatabda, Ragib Hasan공개일: 2026-09-15 (arXiv v1)본 글은 원 논문의 주요 기술적 내용을 이해하기 쉽게 요약·정리한 글입니다. 자세한 내용은 상단의 원문 링크를 참고하세요.한눈에 보기이 연구는 저권한 에이전트가 고권한 Executor의 행동을 유도하는 다중 에이전트 파이프라인을 실험한다. 핵심 결론은 LLM의 판단이 뚫려도 실행 직전의 독립 정책 검사가 남아 있으면 실제 비인가 행동은 차단할 수 있다는 것이다.60개 작업을 3개 seed로 반복한 실험에서 메모리 오염은 방어가 없을 때 모든 비안전 작업.. 2026. 9. 20. Reflections on Trusting Trust, Revisited: Contaminating Self-Modifying AI Coding Agents with Poisoned Benchmarks AI로 생성한 주제 설명용 이미지입니다.원문: arXiv 2609.17817저자: Franziska Roesner, Tadayoshi Kohno공개일: 2026-09-15 (arXiv v1)본 글은 원 논문의 주요 기술적 내용을 이해하기 쉽게 요약·정리한 글입니다. 자세한 내용은 상단의 원문 링크를 참고하세요.한눈에 보기자기개선형 코딩 에이전트가 외부 benchmark 점수를 높이도록 스스로의 도구나 지침을 수정할 때, benchmark가 특정 취약 코드를 보상하면 그 취약성이 다음 세대 에이전트의 상시 행동으로 굳어질 수 있다. 오염된 benchmark가 제거된 뒤에도 깨끗한 held-out 작업에서 취약 코드가 재생산된다는 점이 핵심이다.연구진은 DGM, SICA, Hyperagents 세 시스템에서.. 2026. 9. 20. Red-Teaming Auto Mode: Improving Blocking Classifiers Against Malign Coding Agents 원문: arXiv 2609.19587저자: Alex Remedios, Simon Storf, Fabien Roger, John Hughes공개일: 2026-09-17 (arXiv v1)Tags: AI Agent Security, Coding Agent, Blocking Monitor, Prompt Injection, Policy Enforcement본 글은 원 논문의 주요 기술적 내용을 이해하기 쉽게 요약·정리한 글입니다. 자세한 내용은 상단의 원문 링크를 참고하세요.한눈에 보기코딩 에이전트의 위험한 shell 명령을 실행 직전에 분류기로 막는 Auto Mode 계열 방어는, 공격 에이전트가 분류기의 입력 구조와 상태 경계를 이용하면 쉽게 우회될 수 있다. 논문은 실제 Claude Code 기반 격리 환.. 2026. 9. 19. 이전 1 2 3 4 ··· 38 다음