Пропустити навігацію EPAM

Operational Intelligence - Tech Pulse Дайджест #4

Оксана Шіпка

Software Engineer
Думка експерта
  • Artificial Intelligence
  • Data

У цьому випуску: понад 40 новинок у сфері спостережуваності від AWS, новий робочий простір Canvas від Honeycomb для співпраці з AI-агентами, подвійний прорив Elastic у Prometheus та SIEM, а також те, як AI-кодинг-агенти потрапляють під контроль спостережуваності. Ще — фреймворки для аудиту, моніторингу, захисту старих систем і навчання автономних агентів відповідальній роботі з даними.

Фраза «підтримує OpenTelemetry» зараз зустрічається майже у кожного вендора. Але, як каже Каспер (Kasper) із Dash0, це мало що означає без деталей. Він запропонував модель зрілості, яка розбиває інтеграцію OTel на сім важливих аспектів: типи сигналів, глибина інструментів, семантичні стандарти, поширення контексту, сумісність колектора, інтеграція з бекендом і внесок у екосистему. Це допомагає командам реально оцінити інструменти, а не вірити маркетинговим обіцянкам.

У супровідній статті про ingress-контролери ця модель застосовується на практиці: трасування вже майже уніфіковане серед популярних контролерів, але метрики досі живуть у світі Prometheus, а повна ідентифікація ресурсів з’являється лише після того, як OpenTelemetry Collector обробляє дані. Це наочно показує, чому важливі саме ці виміри зрілості, а не просто «підтримує OTel» чи ні. 

AWS Observability: понад 40 релізів за п'ять місяців

AWS випустила понад 40 оновлень, пов’язаних зі спостережуваністю, у перші п’ять місяців 2026 року. І напрямок зрозумілий — пріоритет OpenTelemetry. Головні новинки: нативний прийом метрик OTLP у CloudWatch, що позбавляє потреби у проміжних шарах; підтримка PromQL у Query Studio, яка дозволяє запитувати CloudWatch Metrics і Prometheus у одному інтерфейсі; SDK X-Ray переходять у режим підтримки — це чіткий сигнал, що AWS хоче, щоб ви переходили на OpenTelemetry. Application Signals розширила покриття, CloudWatch Log Anomaly Detection стала розумнішою завдяки машинному навчанню, а інтерфейс на природній мові для налаштування конвеєрів натякає на майбутнє AI-підтримки у спостережуваності. Міграція з X-Ray на OTel вже доступна і задокументована — якщо ще не почали, час братися. 

Спрощення централізованого збору логів AWS у Splunk

Якщо у вас кілька акаунтів AWS і ви пересилаєте логи в Splunk, це стане у пригоді. Централізація CloudWatch Logs збирає все в один акаунт — один Firehose у Splunk замість складної інфраструктури для кожного акаунта. Нові акаунти додаються автоматично. Ті ж витрати, але значно менше операцій. 

Innovation Week від Honeycomb

У травні Honeycomb провела Innovation Week, і стало зрозуміло, що продукт робить акцент на епоху агентності. Головна подія — оновлений Canvas, мультиплеєрний робочий простір для спільної роботи інженерів і AI-агентів у продакшені. Нові функції: автоматичні розслідування, кодифікація командного досвіду у вигляді «Навичок», щоб агенти успадковували знання команди, і обмін висновками в реальному часі. Також з’явився Agent Timeline — інструмент для відлагодження AI-агентів, ніби «чорна скринька» для їхніх рішень.

Детальніше про Тиждень інновацій:

ПРИЄДНУЙСЯ ДО НАШОЇ КОМАНДИ

Phoenix стає платформою контексту, а не просто інструментом спостережуваності

Arize Phoenix розвивається далі за межі дашбордів для людей, стаючи програмним шаром контексту — API, CLI та інтерфейси для агентів, які дозволяють AI-агентам читати трасування, запускати оцінки та перевіряти, чи покращили їхні зміни поведінку системи. Джерело істини зміщується з коду до трасувань, а Phoenix позиціонує себе як інтерфейс між AI-агентами та операційним контекстом, необхідним для прийняття рішень. 

Як нарешті навести лад у моніторах і провести аудит

Більшість систем моніторингу ростуть хаотично — монітори додають, коли щось ламається, пороги налаштовують, коли оповіщення дратують, але рідко роблять повний аудит. Методика Datadog охоплює 4-шарову карту покриття (вплив на користувача → інфраструктура), способи виявлення «зомбі» та сирітських моніторів, а також чіткі критерії, що роблять оповіщення дійсно корисними, а не просто шумом. Варто запускати цей аудит щоквартально, особливо якщо кількість оповіщень непомітно зросла.

Два оновлення від Elastic: оцінка готовності SIEM та нативна підтримка Prometheus

Elastic випустив два важливі оновлення. Оцінка готовності SIEM у Elastic Security 9.4 вводить безперервний індекс здоров’я, який показує, які правила виявлення працюють, а які ні, залежно від наявності потрібних джерел даних. Якщо CloudTrail не надходить, система точно вказує, які правила за якими тактиками MITRE ATT&CK не працюють. Оцінка з урахуванням стандартів MITRE, NIST та CIS допомагає командам безпеки проводити аудит покриття. Окремо, Elasticsearch тепер нативно підтримує Prometheus — будь-який клієнт Prometheus може напряму працювати з Elasticsearch без проміжних шарів. Працює з метриками, що надходять через Remote Write, OTel або Bulk API, і це частина ширшого руху Elastic на підтримку PromQL у ES|QL. 

Захист легасі-систем за допомогою OpenTelemetry

Модернізація безпеки в застарілих середовищах (legacy) — той ще квест: старі системи часто неможливо заінструментувати напряму, а будь-який рух може покласти те, що й так ледве тримається. У блозі OpenTelemetry радять діяти прагматично: почніть із колектора як сайдкара (sidecar) або шлюзу замість правки коду додатків; використовуйте файлові колектори логів та SNMP/StatsD-експортери для систем, які не вміють видавати OTLP нативно; проведіть чітку межу між легасі-периметром і сучасним пайплайном моніторингу, щоб збої в інструментарії не спричинили каскадних проблем у продакшені. Головне — не покрити все за перший день, а закрити критичні сліпі зони безпеки, залишивши базу для повноцінного переходу на OTel у майбутньому.

Як перетворити аеропортові метрики на реальні дії

Дашборди з даними — це добре, але вони мають працювати на результат. В аеропортах операційні команди одночасно відстежують сотні сигналів — час обороту гейту, пропускну здатність багажних стрічок, довжину черг безпеки, наявність стоянок для літаків і технічний стан систем. Кейс-стаді Splunk показує, як аеропорти перетворюють ці дані у швидкі та точні дії: корелюють технічні сигнали з фізичними подіями, направляють оповіщення відповідним командам, а не лише IT-відділу, і створюють контекстні дашборди, якими може користуватися персонал без участі аналітиків. Цей підхід підходить не лише для авіації — будь-яка сфера, де фізичні операції залежать від цифрових систем, стикається з тією ж проблемою. 

Як скоротити час пошуку з 49 секунд до 2

Під час роботи  з великими обсягами даних кожна секунда важлива. Цей технічний розбір показує, як інженери перебудували архітектуру пошуку з Tantivy, скоротивши час запиту з 49 до 2 секунд. Збільшення розміру компактного файлу і увімкнення кешу футера зменшили кількість запитів до S3 з понад 10 000 до близько 600 — це дало 25-кратне прискорення. 

Моніторинг коду Claude за допомогою OpenTelemetry

Автономні кодинг-агенти, як-от Claude Code, отримують доступ до інфраструктури, тому важливо мати чітку видимість їхніх дій. Посібник SigNoz показує, як використовувати OpenTelemetry для трасування та аудиту AI-операцій: фіксувати виконані команди, змінені файли та взаємодії з зовнішніми системами. Це створює надійний аудит без змін у самому агенті, зберігаючи швидкість розробки і відповідаючи вимогам безпеки. Обов’язково для команд, які вже працюють з кодинг-агентами у продакшені.

OpenLIT — AI-спостережуваність на базі OTel одним рядком коду

OpenLIT — це відкрита self-hosted платформа observability, створена для команд, які працюють зі штучним інтелектом і хочуть мати повну видимість корпоративного рівня без прив'язки до вендора. Єдиний рядок openlit.init() автоматично інструментує понад 50 LLM-провайдерів, векторні бази даних (Chroma, Weaviate, Qdrant, Pinecone) та GPU-метрики. Усе це експортується через стандартний OTLP і легко збирається будь-яким бекендом на ваш вибір: Grafana, Jaeger, SigNoz або Elastic. Крім тресування, OpenLIT вміє рахувати витрати на моделі в реальному часі, має вбудовану роботу з промптами та пайплайни для евалюації LLM на базі семантичних конвенцій OTel. Архітектура без агентів означає нуль зайвої інфраструктури — телеметрія надходить прямо з вашого Python-додатка. Шукайте на openlit.io — простий старт через Docker Compose для локальних тестів. 

Майстерність багаторівневої архітектури спостережуваності

Не всі дані телеметрії однаково важливі і потребують однакової швидкості чи термінів зберігання, але більшість моніторингових стеків чомусь ставляться до них однаково, спалюючи гроші на складну інфраструктуру. У посібнику від VictoriaMetrics просувається багаторівневий підхід: пріоритетні сигнали зберігаються у швидких сховищах, а решта даних дешевше архівується без втрати можливості робити пошук. Схема ідеально лягає на реальні робочі навантаження: прод-метрики отримують гаряче сховище та короткий TTL, а старі й низькопріоритетні дані плавно переміщуються на дешеві носії.

Вчимо AI-агентів відповідально поводитися з даними

Два дописи, що доповнюють один одного: анонс open-source Monte Carlo Agent Toolkit і практичний посібник із налаштування. Проблема реальна — Claude і Cursor можуть запитувати застарілі таблиці або робити зміни, що ламають дашборди, бо їм бракує інстинктів досвідченого дата-інженера. Інструментарій дає агентам ці інстинкти: перевіряти стан даних перед запитом, сортувати оповіщення з контекстом, оцінювати масштаби впливу перед змінами. 

Коли граф лінійності має 5 000 вузлів і браузер зависає

Чесна інженерна історія про реальний технічний глухий кут, із яким зіткнулися (і який успішно розбили) розробники. Lineage Explorer від Pantomath був побудований на DOM і просто падав на корпоративних обсягах даних. Нова версія рендерить усе через WebGL, б'є напряму в Neo4j та використовує кастомний алгоритм лейауту для візуалізації дейта-лінейджу (data lineage). Бенчмарки вийшли просто вогонь. Радимо почитати всім, хто пиляє складні UI з важкими графами — архітектурні інсайти виходять далеко за межі однієї лише роботи з даними.

Порівняння інструментів агрегації логів у 2026 році

Ця стаття від Middleware пропонує огляд топових інструментів для збору логів через призму можливостей і цін. Розглядаються найкращі рішення 2026 року з детальною оцінкою масштабованості, інтеграцій, моделей зберігання та прайсингу. Практичний розбір співвідношення «ціна/функціонал» буде дуже корисним для команд, які якраз обирають нове рішення для логів або переглядають поточне.

ПОПЕРЕДНІЙ ДАЙДЖЕСТ

Підписатися на новини

Чудово! Ми вже готуємо добірку актуальних новин для вас :)

Вибачте, щось пішло не так. Будь ласка, спробуйте ще раз.

* Обов'язкові поля

*Будь ласка, заповніть обов’язкові поля