본문 바로가기
Hack/System

Breaking the Black Box: Byte-Level Boundary Inference of Real-World Antivirus Systems

by Becoming a Hacker 2026. 9. 29.
반응형

  • 원문: arXiv 2609.31012
  • 저자: Jieshuai Yang, Zhi Wang, Yan Jia, Zhenhua Wu, Jianfei Tang, Chenbin Su, Jingwei Ye, Jianwen Tian, Wanpeng Li
  • 공개일: 2026-09-25
  • Tags: 안티바이러스, 블랙박스, 경계추론, PE파일, 모델추출, 악성코드, 회피공격, 대리모델, 바이트분석, AVHunter

본 글은 원 논문의 주요 기술적 내용을 이해하기 쉽게 요약·정리한 글입니다. 자세한 내용은 상단의 원문 링크를 참고하세요.

한눈에 보기

AVHunter는 상용 안티바이러스가 내놓는 binary label만 반복 질의해 판정을 바꾸는 byte-level boundary point와 region을 추론하고, 이를 학습한 surrogate로 낮은 변형량의 회피·오탐 유도 입력을 찾습니다. 11개 실제 AV 제품의 2,651,770개 boundary annotation을 만든 뒤 AV별 AV-DBNet을 학습했습니다.

보고된 평균 boundary F1은 72.70%, surrogate agreement는 97.43%였고 boundary-guided encryption의 평균 회피율은 83.78%, benign injection의 평균 false-positive 유도율은 81.33%였습니다. 하지만 정적 검사 CLI, boundary가 20개 미만인 sample 중심, 반복 질의 가능성이라는 강한 전제가 있어 endpoint 전체 우회로 일반화하면 안 됩니다.

연구 배경

기존 black-box AV 공격은 전체 파일을 하나의 판정 대상으로 보고 heuristic search로 변형 위치를 찾기 때문에 질의와 perturbation이 큽니다. AVHunter는 판정이 민감한 바이트 경계를 먼저 찾아 공격·분석 자원을 그 주변에 집중하면 더 효율적인 surrogate와 변형을 만들 수 있다고 봅니다.

공격 모델 / 전제 조건

공격자는 Windows 환경에서 AV의 정적 CLI scanner에 crafted PE를 반복 제출하고 malicious·benign hard label을 관찰할 수 있습니다. signature, 내부 feature, confidence, model parameter에는 접근하지 않으며 대상 AV 구독 기간 동안 query rate limit이 없다고 가정합니다.

동적 행위 탐지, cloud reputation, EDR correlation, 실제 victim interaction은 범위 밖입니다. 공격 성공은 변형 파일이 정적 scanner label을 바꾸고 제한된 기능 검사에서 동작을 유지하는 것으로 측정합니다.

비판적 검토 / 아쉬운 점

가장 큰 쟁점은 반복 질의 가능한 local CLI와 무제한 rate라는 현실성입니다. 관리형 endpoint는 cloud lookup, telemetry, tamper protection, query throttling을 함께 쓰므로 실제 배포에서 같은 66.53 queries/sample이 가능하고 은닉되는지 측정해야 합니다.

둘째, 연구는 93.26%의 sample이 20개 미만 boundary point를 갖는다는 관찰에 맞춰져 있습니다. 다수 boundary, packed·self-modifying binary, 비PE 형식에서도 탐지·회피 품질이 유지되는지 추가 실험이 필요합니다.

셋째, 기능성 검증은 알려진 48개 sample로 제한됩니다. label evasion이 실제 payload 실행, 서명·loader 안정성, dynamic detection 회피를 보장하지 않으므로 더 넓은 sandbox 행동 검증이 필요합니다.

핵심 Root Cause

근본 원인은 black-box 판정이 비밀이어도 입력 바이트의 국소 변형에 대한 label 변화가 decision boundary 정보를 누설한다는 점입니다. 깨진 불변조건은 “외부 사용자가 반복 hard-label query만으로도 내부 판정에 중요한 바이트 위치와 지역을 안정적으로 역추론할 수 없어야 한다”입니다.

AV 제품이 deterministic static label을 빠르게 반환하고 query 간 연계를 탐지하지 않으면 suffix masking과 binary search로 민감 지점을 찾을 수 있습니다. 이 위치 정보는 단순 분류 label보다 훨씬 강한 supervision이 됩니다.

핵심 공격 원리

BABD는 PE suffix를 마스킹하며 binary search로 첫 boundary point를 찾고, 찾은 지점을 다시 가린 뒤 과정을 반복합니다. 각 point 주변을 k=30, h=10 설정으로 확장해 boundary region을 만들고, 원본 label과 위치 annotation을 함께 수집합니다.

AV-DBNet은 multi-scale convolutional encoder, attention fusion, dual-head decoder로 AV 분류와 boundary 예측을 공동 학습합니다. 예측된 region만 암호화하거나 benign sample에 악성 region을 주입해 적은 바이트 변경으로 label을 움직입니다.

공격 흐름

  1. 대상 PE를 AV CLI에 제출해 기준 label을 얻습니다.
  2. suffix masking과 binary search로 label이 바뀌는 byte offset을 찾습니다.
  3. 이미 찾은 지점을 마스킹하고 반복해 boundary point 집합을 구성합니다.
  4. 주변 region을 annotation으로 만들어 AV별 surrogate를 학습합니다.
  5. malware에서는 예측 region을 변형해 evasion을, benign에서는 region을 주입해 false positive를 시험합니다.

성공 조건 / 실패 조건

공격은 scanner가 결정론적 hard label을 반복 반환하고, 소수 국소 바이트가 판정에 큰 영향을 주며, 변형 뒤 PE 기능이 유지될 때 성공합니다. surrogate가 현재 AV 버전과 충분히 일치해야 합니다.

cloud·dynamic 검사, query correlation, randomized response, 모델 대규모 업데이트, integrity·signature 검증이 추가되거나 판정 근거가 넓게 분산되면 실패율이 커집니다. ESET과 FProtect에서는 benign injection false positive가 발생하지 않아 제품별 편차도 큽니다.

연구진의 실험 환경

Windows 11, RTX 4080 SUPER, Intel i7-14700K에서 11개 AV를 기본 설정으로 평가했습니다. 대상은 ClamAV, Defender, Kaspersky, ESET, Avast, AVG, DrWeb, Vba32, IkarusT3, FProtect, McAfee이며 AV별 모델을 50 epoch, 5:1 stratified split으로 학습했습니다.

BABD는 241,070개 sample에 11개 AV label을 붙였고 BODMAS malware 30,000개, SOREL malware 60,419개, 내부 malware 30,154개와 benign 120,497개를 사용했습니다. 표 기준 train은 malware 100,478·benign 100,413, test는 malware 20,095·benign 20,084이며 총 2,651,770 annotation을 생성했습니다.

주요 실험 결과

BABD는 sample당 평균 66.53회, boundary point당 19.20회 질의와 sample당 1.91초를 사용했습니다. 평균 BPR 85.07%, BPP 64.29%, F1 72.70%, BRCR 0.05%였습니다.

boundary region encryption의 평균 evasion은 83.78%, perturbation은 3.22%로 GAMMA 9.43%/345.37%, MalGuise 20.87%/11.31%보다 높고 작았습니다. benign injection은 11개 중 9개 AV에서 평균 81.33% false positive, perturbation 0.26%였으며 ESET과 FProtect는 0이었습니다.

surrogate agreement는 97.43%, adversarial detection은 89.86%로 비교군 94.67%/62.51%, 94.50%/59.46%보다 높았습니다. boundary loss 제거 시 89.79%/55.95%, random boundary는 91.33%/58.49%였습니다. 7개 제품의 agreement는 초기 97.53%에서 3개월 96.39%, 7개월 95.94%로 1.59%p 감소했고 회피율은 평균 7.26%p 감소했습니다.

실제 발견된 취약점 / 사례

논문은 개별 CVE보다 11개 AV가 hard-label boundary leakage를 보인다는 시스템적 사례를 제시합니다. 특히 9개 제품에서 benign region injection으로 높은 false positive를 유도했고, 정적 malware label도 낮은 perturbation으로 회피했습니다.

다만 제품별 버전 문자열과 disclosure·패치 상태를 완전하게 연결하지 않아 특정 설치가 취약하다고 단정할 수 없습니다. 결과는 평가 기간의 default CLI configuration에 대한 측정입니다.

저자 주장 vs 실제 증명 범위

hard label만으로 boundary를 추론하고 surrogate·변형 성능을 높일 수 있다는 주장은 대규모 annotation, ablation, 7개월 temporal test로 잘 뒷받침됩니다. boundary supervision의 기여도도 no-boundary·random 비교로 분리했습니다.

하지만 “현실 AV 시스템을 깨뜨린다”는 제목을 endpoint compromise 전체로 해석하면 과도합니다. 실제 증명은 정적 CLI label, 일부 기능 유지, 제한된 AV 버전과 query 조건에 한정되며 dynamic·cloud layer는 평가하지 않았습니다.

기존 공격 / 기존 점검 방식과의 차이

GAMMA와 MalGuise가 label 회피를 위한 변형을 직접 탐색한다면 AVHunter는 먼저 byte-level decision boundary를 데이터로 만들고 학습합니다. 이로써 공격뿐 아니라 surrogate fidelity와 adversarial detection에도 같은 boundary 표현을 재사용합니다.

연구의 한계와 주의해서 볼 부분

저자는 static-only, query 비용, dataset diversity, 적은 boundary sample 편향, misuse 위험 때문에 surrogate와 annotation을 공개하지 않는 점을 인정합니다. dynamic·cloud scanner가 최종 실행을 잡을 수 있으며 높은 offline ASR은 production bypass와 다릅니다.

추가로 AV update가 7개월 동안 성능을 서서히 낮췄지만 major engine change나 signature outbreak 상황은 없습니다. 라이선스·서비스 약관과 안전한 malware handling도 재현 비용에 포함돼야 합니다.

공개 PoC / Exploit / Tool / Artifact 분석

논문은 익명 AVHunter artifact를 제시합니다. 2026-09-29 실제 접속 시 서비스가 HTTP redirect 뒤 {"error":"not_connected"}를 반환해 README·코드·환경·commit을 확인하거나 재현 가능한 공개 PoC로 검증할 수 없었습니다.

논문은 민감한 surrogate model과 boundary annotation을 공개하지 않는다고 명시합니다. 따라서 링크가 복구되더라도 공개 구현이 논문의 전체 공격 자산을 포함한다고 가정해서는 안 되며, 현재는 공식 GitHub 원본도 확인되지 않아 ZIP을 보관하지 않았습니다.

레드팀 / 모의해킹에서 어떻게 활용할까

승인된 lab의 비실행 dummy PE와 전용 scanner snapshot으로 hard-label stability, query correlation, boundary concentration을 측정합니다. 실제 malware나 production endpoint를 사용하지 않고, 변형 뒤 기능 검증도 격리 sandbox에서 안전한 marker 동작으로 제한합니다.

검증 기준은 label flip 자체보다 필요한 query 수, boundary 재현성, 엔진 업데이트 후 decay, cloud·dynamic layer의 보완 탐지입니다. sample이 실행 환경을 벗어나거나 실제 payload가 활성화되면 즉시 중단합니다.

실제 점검 시 추가할 체크리스트

  • scanner가 반복 동일·근접 sample 질의를 탐지하고 제한하는가
  • static·cloud·dynamic verdict가 독립적으로 결합되는가
  • hard label 응답이 불필요한 세부 신호를 누설하지 않는가
  • boundary가 특정 header·section·signature에 과도하게 집중되는가
  • 모델 업데이트 뒤 이전 surrogate의 agreement가 얼마나 남는가
  • benign false-positive injection에 제품별 차단이 있는가
  • 기능성 검증이 단순 실행 여부와 실제 동작을 구분하는가
  • 모든 실험이 격리·승인·무외부전파 조건을 지키는가

실무 가치 평가

방어자 관점의 가치는 AV를 “label oracle”로 노출했을 때 생기는 모델 추출 위험을 정량화한 데 있습니다. query telemetry, 다층 판정, 경계 집중도 점검과 adversarial regression test 설계에 직접 활용할 수 있습니다.

공격 성능 수치를 실전 우회율로 받아들이면 위험합니다. 제품 운영에서는 endpoint 전체 stack, 모델 update, cloud reputation, 실행 행위까지 포함한 방어 심층성을 함께 평가해야 합니다.

결론

AVHunter는 binary label만으로도 byte-level 경계가 대규모 supervision으로 변할 수 있음을 보여주며, 11개 AV에서 높은 surrogate agreement와 낮은 변형량의 label manipulation을 보고했습니다. ablation과 temporal test가 포함돼 연구 설득력도 높습니다.

그러나 static CLI와 제한된 sample이라는 경계를 지켜 읽어야 합니다. 현재 artifact 접속 실패로 공개 재현성도 확인되지 않았으므로, 결과는 강한 경고이되 production compromise의 직접 증거는 아닙니다.

반응형

댓글