отказоустойчивость.

Под с GPU не лечится рестартом: устраиваем отказ устройства в кубере и чиним без вечного Pending

В 2024 году была опубликована интересная статья

продолжить чтение

От «пяти девяток» до антихрупкости. Как менялось представление о надежности ИТ-инфраструктуры за 25 лет

Надежная ИТ-инфраструктура как здоровье – пока она есть, ее никто не замечает. Но за четверть века подходы к реализации ее надежности сильно поменялись: сначала компании пытались не допустить сбой вообще, потом научились быстро восстанавливаться после него, а теперь — проектируют системы так, чтобы они продолжали работать и становились сильнее даже в условиях хаоса.

продолжить чтение

Модель не виновата: разбираем 3 громких ИИ-инцидента, которые случились из-за отсутствия архитектуры

продолжить чтение

Когда ИИ-агент ошибается молча: 6 отказов, которые не видно по ответу

ИИ-агент — не чат-бот. Чат-бот генерирует текст. Агент совершает действия: читает документ, решает, какие инструменты вызвать, выполняет многошаговый рабочий процесс и выдает результат, на основании которого без дополнительной проверки действуют системы-потребители — а иногда и люди.Когда агент составляет ответ, цена ошибки — неудачный абзац. Когда он одобряет кредит, подает регуляторную отчетность или запускает эскалацию, ошибка может обернуться операционными, финансовыми или репутационными потерями.

продолжить чтение

DDoS: от алерта до выбора модели: диагностика DDoS и Always-On vs On-Demand

Когда на графиках мониторинга появляется аномальный всплеск трафика, ваш первый порыв — сразу врубить фильтры и блокировать всё подозрительное, но на практике именно подобное чаще всего приводит к ошибкам.На самом деле DDoS-защита начинается не с выбора сервиса и не с настройки правил — она начинается с диагностики. В этой статье мы разберём полный цикл: от момента появления алерта до выбора между Always-On и On-Demand моделями защиты.Часть 1. Диагностика и реагированиеА точно ли это DDoS?

продолжить чтение

Что происходит с LLM‑пайплайном, если провайдер падает посреди выполнения

В 2025 году каждый крупный провайдер LLM пережил минимум один значимый сбой. Большинство решений этой проблемы — gateway‑слой снаружи приложения: LiteLLM, Bifrost, Kong AI Gateway. Они перехватывают упавший HTTP‑запрос и повторяют его на другом провайдере.Это работает для одного вызова, но не работает для многошагового пайплайна — gateway не знает, что упавший запрос был вторым шагом из трёх. Он видит запрос, которому нужен retry, а не позицию в конечном автомате.В этой статье — как реализовать fallback провайдера как явный переход FSM на реальном стеке llm‑nano‑vm 0.8.6

продолжить чтение

Как построить и проверить катастрофоустойчивость в облаке: от плана до Game Day

продолжить чтение

Хроники Облачного княжества: как я приручал монолит‑дракона: Орден SLO и игла Кощея

Часть 3.Самая опасная магия в IT — это магия целей. Потому что цель легко обещает, а потом требует процентами отчёта.Есть особый вид страха, который появляется у инженера, когда два календаря совпадают.Первый календарь — релизный.Второй — организационный.И когда в один и тот же день на вас назначают «большую миграцию» и «большую презентацию результатов», реальность начинает пахнуть дымом ещё до того, как загорелся прод.Архимаг OKR стоял у проектора и рисовал стрелки.

продолжить чтение

Фреймворк отказоустойчивости для интерфейсов разговорного ИИ

Перевод подготовил автор канала Друг Опенсурса, приятного прочтения, заранее благодарю за подписку В статье описывается навигационная структура из 20 UX-паттернов, разделенных на уровень стабильности, фокуса, ясности и контроля. Подход предполагает использование чата как механизма обработки, а документа как основной рабочей области. Проблема интерфейсов на базе чата

продолжить чтение

Что делать, когда AI-агент «упал»: архитектура отказоустойчивости

Понедельник, 9 утра. Начало рабочей недели.API OpenAI лёг. Или лимиты закончились. Или интернет в офисе пропал.Что делает AI-агент? Ничего. А процесс, который он обслуживал, встаёт. Заявки копятся, договоры не согласовываются, клиенты ждут.И хуже всего — люди не знают, что агент не работает. Думают, что всё идёт по плану.Реальные сценарии сбоевЗа год работы с AI-агентами в проде я собрал коллекцию того, что ломается.Сбои провайдера LLM. OpenAI: 2-3 крупных сбоя в год плюс периодические замедления. Anthropic: реже, но бывает. GigaChat: стабильнее, но тоже не без проблем.Сетевые проблемы.

продолжить чтение

12