Decentralization of multi-criteria optimization of SRv6 routes based on implicit stigmergy: theoretical foundation and positioning among modern DRL approaches
DOI:
https://doi.org/10.31673/2412-9070.2026.047904Abstract
У статті розглядається задача багатокритеріальної оптимізації (БО) маршрутів у програмованих мережах SRv6 за чотирма QoS-критеріями (затримка, пропускна здатність, втрати пакетів, джитер). Існуючі методи на основі глибокого навчання з підкріпленням (DRL) — AROM-DRL (Tayeh, 2022), MDQ (Zhang та ін., 2024), QR-MO (arXiv:2503.18122, 2025), WA-SRTE (IEEE ICC, 2024) та подібні — розв’язують БО в централізованому контролері SDN, де єдиний арбітр визначає вагову згортку критеріїв або обчислює Парето-множину. Запропоновано принципово іншу архітектуру: БО розв’язується незалежно кожним з автономних AI-агентів на граничних маршрутизаторах, а узгодженість їх рішень у масштабах мережі досягається через імпліцитну стигмергію — спільне зчитування синхронізованої бази даних стану каналів IS-IS (LSDB) як стигмергічного середовища. Стаття формалізує модель координації за Heylighen (2016) у застосуванні до IGP LSDB як медіуму, обґрунтовує методологічну роль обмежень відкритого стека (FRRouting + IS-IS flat area + SRv6 BE + Linux LWT) як стратегії «найгіршого випадку» та пропонує п’ятивісне порівняння з основними сучасними роботами. Доведено, що тільки запропонована архітектура задовольняє одночасно всі п’ять критеріїв: ≥3 QoS-метрики, edge-inference, GNN-узагальнення, відсутність контролера, eBPF-телеметрія для функції винагороди. Емпірична перевірка допустимості координації спирається на експериментальну процедуру з п’яти послідовних фаз (єдине переключення в кожному напрямку, TRIGGER 409 мс, WITHDRAW 825 мс, нуль хибних спрацювань у трьох baseline-фазах). Реакція агента переважно структурно зумовлена (мінімум гістерезису K-of-N + інтервал зонду + actuation), не вартістю AI — GNN-виведення ONNX INT8 складає субмілісекундний час (менше 0,1 % часу реакції). Симетричний бар’єр WITHDRAW реалізовано без жорсткого порогу через узгодження вхідного представлення з розподілом тренувальних ознак (training-distribution-matched feature wiring) — та сама нейромережа на 40 мс SLA-границі керує переключеннями в обох напрямках.
Ключові слова: багатокритеріальна оптимізація, інформаційна система, інформаційна технологія, машинне навчання, маршрутизація SRv6, імпліцитна стигмергія, децентраліза-
ція, GNN, PPO, eBPF.