RU

Человек между агентом и кнопкой: почему слой подтверждения — это такая сложная инженерия

Мой агент дошёл до состояния, когда я перестал читать письма перед отправкой. Между «агент решил» и «письмо ушло» не было ничего — ни…

llm-агентыpythonsqlitehuman-in-the-loopexactly-onceтестированиемутационное тестированиеконкурентность
Habr
RU

Все пять safety-свойств Raft прошли. Две реплики разошлись

Реализация Raft на TypeScript под сидированной симуляцией: каждый тик, каждая задержка сообщения и каждое падение узла берутся из сида. На двадцать…

raftконсенсусдетерминированное тестированиемутационное тестированиеmodel checkingлинеаризуемостьизоляция транзакцийpostgresqltypescript.
Habr
RU

ИИ пишет тест-кейсы и автотесты за тебя: как их генерировать и не получить ложное покрытие

Генерация тест-кейсов — один из первых сценариев, с которых компании внедряют ИИ в тестирование. Отдаёшь модели требования или код — через несколько…

автогенерация тест-кейсовгенерация тест-кейсовии в тестированиитест-дизайнложное покрытиеавтотестыревью тест-кейсовмутационное тестированиеклассы эквивалентностиграничные значения
Habr
RU

[Перевод] Мы дали ИИ написать код и тесты: что обнаружило мутационное тестирование

AI-агент самостоятельно создавал приложение и по ходу работы покрывал его тестами, а качество кода оценивали автоматические проверки. На первый взгл…

мутационное тестированиеИИ-агентыгенерация тестовкачество кодасопровождаемостьстатический анализESLintStrykerрегрессионное тестированиеархитектура кода
Habr
RU

Ложное чувство защиты: Почему 90% code coverage не спасает от багов

90% code coverage выглядит как повод выдохнуть — до первого бага, который спокойно проходит сквозь все тесты и добирается до прода. В статье разберё…

qamutation-testingпокрытие кодамутационное тестированиеавтоматизированное тестированиекачество тестов
Habr
RU

ИИ уже пишет 80% кода Anthropic. Самое тревожное спрятано в цифре, которую подают как успех

Anthropic отчиталась, что больше 80% её кода теперь пишет Claude, — а её же автоматический проверяющий ловит лишь треть прошлых ошибок, то есть две…

самогенерация ИИнезависимая проверкавалидаторымутационное тестированиеформальная верификацияПЛКIEC61508METRнадежность кодаanthropic