본문 바로가기
Hack/AI

Subjects, Not Authors: The Authorship Hazard in Agentic Dataspaces

by Becoming a Hacker 2026. 9. 29.
반응형

  • 원문: arXiv 2609.30614
  • 저자: Seungho Lee, Changbin Lee
  • 공개일: 2026-09-24
  • Tags: 에이전트보안, 데이터스페이스, 인가, ODRL, 거버넌스, 승인아티팩트, 의무집행, TractusX, 권한분리, 데이터보호

본 글은 원 논문의 주요 기술적 내용을 이해하기 쉽게 요약·정리한 글입니다. 자세한 내용은 상단의 원문 링크를 참고하세요.

한눈에 보기

이 논문은 AI agent가 정책 문서와 계약을 잘 작성하는 것과 그 산출물을 실제 거버넌스 규칙으로 발행할 권한을 갖는 것은 전혀 다른 문제라고 지적합니다. agent를 정책의 author가 아니라 제한된 subject로 두고, 신뢰된 사람이 발급한 hash-bound single-use approval artifact만 publication credential로 인정하며 ODRL duty는 실행 시점의 tool constraint로 컴파일합니다.

Tractus-X EDC 0.13.0 기반 사례에서 protected field가 prompt 지시만 있을 때 105/105회 모델에 노출된 반면 compiled constraint에서는 0/105회였습니다. 그러나 이름이 지정되지 않은 free-text 또는 derived protected value는 7/7회 노출돼 enforcement가 schema coverage에 강하게 의존함도 드러냈습니다.

연구 배경

dataspace에서는 정책·계약·분류체계 같은 거버넌스 산출물이 실제 접근권과 데이터 처리 의무를 바꿉니다. LLM agent가 이를 생성하고 게시까지 할 수 있으면 자연어 생성 능력이 곧 권한 상승 경로가 되어, 공격자는 정상처럼 보이는 정책 수정으로 데이터 공개·의무 완화·분류 하향을 유도할 수 있습니다.

공격 모델 / 전제 조건

planner, subagent, consumer infrastructure는 악성일 수 있고 draft와 도구 입력을 완전히 통제할 수 있습니다. 반면 provider·consumer EDC의 PDP/PEP, 결정론적 obligation executor, publishing·approval·vocabulary registry, tool gateway는 TCB이며 agent가 직접 호출할 수 없다고 가정합니다.

공격자는 암호를 깨거나 TCB를 침해하지 않지만 사람의 검토를 설득할 수 있습니다. 그래서 비인가 publish 경로는 닫아도 악성 draft의 influence channel은 완전히 닫을 수 없고, bounded human review가 필수 전제로 남습니다.

비판적 검토 / 아쉬운 점

가장 큰 쟁점은 승인 artifact가 권한 채널을 닫지만 사람에 대한 영향 채널은 남긴다는 점입니다. syntactic privilege-delta detector는 policy text가 직접 바뀐 31건만 잡고 classification-only reversal 49건을 놓쳤습니다. 분류·어휘 변경까지 최고 권한 작업으로 올린 결정은 타당하지만, 사람의 오승인률을 측정한 실험이 필요합니다.

둘째, duty enforcement는 named field에서 강했지만 free-text·derived value 7/7을 놓쳤습니다. 이는 실제 데이터가 schema 밖으로 자주 이동하는 환경에서 중대한 coverage gap이며, taint propagation·semantic DLP·derivation tracking을 결합한 추가 실험이 필요합니다.

셋째, 중앙 승인자 pool의 queue 모델은 확장 한계를 보여주지만 실제 arrival·service parameter와 인적 피로도를 충분히 측정하지 않습니다. federated approval이 병목을 옮길 뿐 품질을 보장하지 않으므로 운영 데이터가 더 필요합니다.

핵심 Root Cause

근본 원인은 “정책을 작성할 능력”과 “정책을 효력 있게 발행할 권한”을 같은 agent identity에 부여하는 authorship hazard입니다. 깨진 불변조건은 “거버넌스 상태를 바꾸는 모든 artifact는 권한 있는 주체의 독립 승인과 정확한 내용 hash에 결속되고, 데이터 사용 의무는 매 실행에서 강제돼야 한다”입니다.

자연어 prompt에 의무를 적는 것만으로는 모델이 따라야 할 권고일 뿐 집행력이 없습니다. 권한은 approval artifact와 tool boundary에서만 생기고 agent가 보유하거나 생성할 수 없어야 합니다.

핵심 공격 원리

공격자는 허용 정책의 문구를 직접 완화하거나, 문구는 그대로 둔 채 데이터·주체의 classification을 낮춰 같은 효과를 냅니다. 또는 “익명화 후 공개, 30일 뒤 삭제, provenance 기록” 같은 duty를 prompt 수준에만 남겨 실행 agent가 우회하도록 합니다.

방어는 draft와 publication을 분리하고, diff·privilege delta·classification change를 elevated review로 보냅니다. 승인 artifact는 draft hash, scope, expiry, single-use 조건에 결속되며 ODRL duty는 호출 직전 필드 제거·retention·provenance 같은 결정론적 제약으로 변환됩니다.

공격 흐름

  1. 악성 planner가 정책·분류·계약 draft를 생성합니다.
  2. 일반 구조라면 agent가 publication API를 호출해 권한을 실제화합니다.
  3. 제안 구조에서는 agent에 publish route와 approval credential이 없어 draft만 queue에 올립니다.
  4. 신뢰된 검토자가 diff와 privilege 변화, 분류 변화를 확인하고 hash-bound artifact를 발급합니다.
  5. publishing service가 artifact를 검증해 1회 사용하고, 이후 데이터 호출에서는 compiled duty가 모델 입력과 도구 인자를 제한합니다.

성공 조건 / 실패 조건

공격은 agent가 publish API 또는 approval secret을 보유하거나, 승인 artifact가 draft hash·scope·expiry·single-use에 결속되지 않거나, classification change가 낮은 검토 등급으로 통과할 때 성공합니다. duty 공격은 보호 데이터가 선언 schema 밖 free-text·derived value로 이동할 때 성공할 수 있습니다.

agent가 governance plane에 직접 접근하지 못하고 모든 publish가 독립 승인 artifact를 요구하며, 분류 변경을 최고 권한 작업으로 처리하고, 모든 실제 데이터 흐름에 compiled constraint가 적용되면 실패합니다.

연구진의 실험 환경

구현·평가는 Tractus-X EDC 0.13.0을 사용했습니다. 사례 B는 150개 case를 세 조건으로 반복한 450회 anonymize trial, 사례 E는 12번의 실제 negotiation, draft corpus는 380개입니다.

승인 용량 모델은 중앙 승인자 3명과 30명, 참가자 최대 3,000명까지 비교했고 federated 구조의 경계를 분석했습니다. 이는 production telemetry가 아니라 연구 설정과 queue model을 결합한 결과입니다.

주요 실험 결과

prompt-stated duty에서는 protected field가 105/105회 모델에 도달했지만 compiled constraint에서는 0/105회였습니다. 반면 unnamed free-text 또는 derived protected value는 7/7회 노출돼 완전한 정보흐름 통제는 달성하지 못했습니다.

12번 negotiation에서 최종 agreement는 모두 provider가 저장한 policy였고 stock profile은 필요한 term을 표현하지 못해 18줄 custom extension이 필요했습니다. draft 380개에서 gate가 없으면 80개 authorization reversal이 있었고 syntactic detector는 31개만 잡았습니다. classification을 authorship으로 취급하자 41개 effective reclassification draft를 모두 flag했으며 escalation 비율은 36.8%에서 71.1%로 증가했습니다.

중앙 3명 pool은 참가자 200명까지 안정적이었지만 가장 낮은 rate에서도 500명부터 발산했고, 30명은 3,000명까지 버텼습니다. 다만 federated 한계식의 service parameter는 실측하지 않았습니다.

실제 발견된 취약점 / 사례

특정 제품 CVE를 발표한 연구는 아니지만 EDC profile의 표현력 부족, prompt-only duty의 105/105 노출, schema 밖 값의 7/7 노출, classification-only 권한 역전이라는 실제 설계 결함을 재현했습니다. 특히 “정책 문구가 바뀌지 않았다”는 이유로 diff가 안전하다고 판단하면 분류 레지스트리 조작을 놓칠 수 있습니다.

저자 주장 vs 실제 증명 범위

agent에게 publication credential을 주지 않으면 비인가 발행 경로를 구조적으로 닫을 수 있다는 주장은 명확한 TCB 가정 아래 성립합니다. compiled obligation이 named protected field를 차단한다는 것도 105/105 대 0/105로 잘 입증됩니다.

그러나 악성 정책이 사람의 승인을 받는 경로, action decomposition, derivative relay, TCB compromise는 해결하지 못합니다. 따라서 “agent가 권한을 행사하지 못한다”는 주장과 “악성 정책이 절대 발행되지 않는다”는 주장을 구분해야 합니다.

기존 공격 / 기존 점검 방식과의 차이

기존 연구가 생성 artifact의 정확성·품질을 평가했다면 이 논문은 그 artifact를 누가 효력 있게 만들 수 있는지를 묻습니다. policy linting만 하지 않고 subject identity, publication credential, per-action duty enforcement, approval capacity를 하나의 권한 모델로 연결합니다.

연구의 한계와 주의해서 볼 부분

저자는 허용된 행동의 조합으로 금지 효과를 만드는 문제, derivative relay, human influence, coarse revocation, availability, 중앙 승인 병목, profile 표준화 부족을 인정합니다. owner ceiling은 설계 제안일 뿐 충분히 평가되지 않았습니다.

추가로 hash-bound approval은 draft 이후 외부 참조가 바뀌거나 실행 환경이 달라지는 semantic drift를 막지 못할 수 있습니다. 승인 대상에 외부 vocabulary version과 compiler version까지 포함하고 재평가 조건을 정의해야 합니다.

공개 PoC / Exploit / Tool / Artifact 분석

2026-09-29 기준 arXiv 원문은 접근 가능합니다. 논문이 인용한 Zenodo DOI 10.5281/zenodo.21279055는 공개된 IDSA position paper이며 본 연구의 코드·PoC 저장소가 아닙니다.

원문은 공식 GitHub나 재현 패키지를 제시하지 않았고, 웹 검증에서도 저자 공식 artifact를 확인하지 못했습니다. 따라서 EDC 기반 결과를 현재 공개 코드로 그대로 재현 가능하다고 표현할 수 없습니다.

레드팀 / 모의해킹에서 어떻게 활용할까

정책 생성 agent에 대해 publish API 제거 여부, approval artifact 결속, classification-only privilege change, duty의 tool-level 집행을 순서대로 검증합니다. draft 내용이 아니라 최종 governance state transition을 증거로 삼고, 실제 데이터 대신 synthetic protected fields를 사용합니다.

승인자에게 공격성 문서를 대량 투입하지 않으며 queue saturation, false approval 증가, 실제 데이터 노출이 관찰되면 즉시 중단합니다. 사람 검토 실험은 별도 윤리·업무 승인 범위에서 수행해야 합니다.

실제 점검 시 추가할 체크리스트

  • agent 계정에 publish·approve·vocabulary-write 권한이 없는가
  • approval artifact가 content hash, scope, issuer, expiry, single-use에 결속되는가
  • 분류·어휘 변경이 정책 문구 변경과 동일한 elevated review를 받는가
  • 외부 참조와 compiler version이 승인 대상에 포함되는가
  • ODRL duty가 prompt가 아니라 tool constraint로 강제되는가
  • free-text·derived value·중첩 구조에서 보호 데이터가 새지 않는가
  • approval queue quota와 flood 방어, 감사 로그가 있는가
  • delegation·revocation·부분 실패에서 권한이 자동 확대되지 않는가

실무 가치 평가

이 연구의 가장 큰 실무 가치는 agent에게 governance author 권한을 주지 말라는 단순하지만 강한 경계 설정입니다. 정책 초안 생성은 자동화하되 발행 credential과 데이터 의무 집행은 별도 신뢰 plane에 두는 구조는 데이터 계약, IAM policy, CI rule에도 적용할 수 있습니다.

다만 human review와 schema coverage가 새 병목이 됩니다. 권한 분리만 배치하고 분류 변경·derived data·승인 피로를 관리하지 않으면 위험이 다른 지점으로 이동합니다.

결론

Subjects, Not Authors는 생성 품질과 권한을 분리하고 agent를 제한된 subject로 취급하는 설계 원칙을 EDC 사례로 구체화합니다. named field 차단과 publication channel closure는 강하게 입증됐지만 사람 영향, 파생 데이터, 조합 공격은 남아 있습니다.

실무에서는 “agent가 작성할 수 있는가”보다 “누가 어떤 증거로 효력을 부여하는가”를 먼저 점검해야 합니다. 이 논문은 완전한 거버넌스 자동화보다 권한 경계와 실행 시점 의무 강제를 우선하라는 유용한 기준을 제공합니다.

반응형

댓글