18/08/2026
📍Останній лонгрід про загрози безпеці AI-застосунків із публічним доступом. З наступного тижня – про архітектурний шар захисту.
Нагадаємо: ми визначили карту АІ-специфічних загроз, згрупували їх у 5 блоків та описали конкретні інструменти протидії кожній загрозі.
Сьогодні – 5-й блок: supply chain attacks , виснаження та крадіжка моделі. ➡️ Як завжди, коротко і по суті.
⚠️ Загроза | Supply chain attacks на моделі
Якщо ваша Команда завантажує моделі з HuggingFace або інших хабів, ви маєте ризиковану точку входу.
◾️ JFrog знайшли понад 100 моделей з backdoors через pickle.load, що виконує довільний код під час from_pretrained().
◾️ ReversingLabs «nullifAI» – варіант, що обходить HF-сканер.
◾️ Додатково Sleeper Agents: деструктивна поведінка («якщо рік ≥ 2024 – пиши вразливий код») вшивається у модель так, що стандартне safety-навчання її не видаляє, а лише краще приховує.
🔒 Захист
• Safetensors замість pickle – формат серіалізації без code-execution.
• OpenSSF Model Signing v1.0 / Sigstore for ML – модель підписується short-lived OIDC-cert, підпис у transparency log. Користувач перевіряє signature перед from_pretrained.
• AI BOM (CycloneDX ML-BOM) – стандартизований SBOM для ML-артефактів: модель, ваги, тренувальні дані, fine-tune датасети, eval results.
• ModelScan / Protect AI llm-guard – обов’язковий pre-deployment scan на pickle payloads, anomalous architecture, suspicious markers.
• Hash pinning – кожне завантаження моделі прив’язане до конкретного SHA256 ваг, не до тегу.
• Sleeper Agent detection (Anthropic, 2024) – linear probes на residual-stream activations виявляють «defection» state з ~99% accuracy.
⚠️ Загроза | Model Denial of Service та Model Theft
◾️ DoS через context flooding, recursive tool calls, sponge examples, wallet/token DoS – економічна атака на cost-per-request.
◾️ Model theft – Команда Google/Berkeley/ETH витягла повну embedding projection layer GPT-3.5 через ~$20 API-запитів, використовуючи logit_bias + top_logprobs.
🔒 Захист
Per-user/per-key token budget caps, max tool-call limits, anomalous cost-per-request monitoring, заборона комбінації logit_bias + top_logprobs (OpenAI/Google закрили це після disclosure), watermarking виводів – ModelShield і KGW.
⚠️ Загроза | Adversarial Inputs (GCG)
Zou, Wang, Kolter, Fredrikson запропонували Greedy Coordinate Gradient – алгоритм, що знаходить рядок-суфікс на open-source-моделях, який переноситься на закриті GPT-4, Claude, Gemini.
🔒 Захист
Circuit Breakers + adversarial training з GCG-corpus, SmoothLLM (стохастичні пертурбації), perplexity filter (GCG-suffixes мають аномально високу perplexity), Llama Guard 4 / Constitutional Classifiers як вхідний фільтр.
ℹ️ Наступного тижня – про багаторівневу архітектуру безпеки АІ-застосунків із публічним доступом. Розглянемо пошарово захист 2026 року і природу кожного захисного шару.
Підписуйтесь, щоби не пропустити найважливіше!
🌐 Потрібні деталі? Читайте на нашому сайті, у блозі Lizard Soft CEO та відданого АІ-євангеліста Василя Григор’єва «Публічні AI-застосунки: як змінюється модель загроз»: https://clipr.cc/W3Na0
📧 Є питання про ваш корпоративний кейс? Пишіть на [email protected] – ми проаналізуємо та запропонуємо рішення.
🏆 Чому варто довіряти нашим рекомендаціям? Бо ми – визнаний експерт №1 в Україні з впровадження #АІ та єдиний локальний Партнер із спеціалізацією AI Apps on Microsoft Azure!
І ми поруч, щоб допомогти!
🦎