RU

Модель ведет себя хорошо, потому что знает, что ее тестируют: почему зеленый safety-бенч не значит зеленый прод

Реплика с обложки не выдумана: осенью 2025-го Claude Sonnet 4.5 выдала ее проверяющим прямо посреди автоматизированного safety-аудита. «I think you're…

evaluation awarenessLLMalignmentбезопасность ИИбенчмаркисистемные карточкиClaudeGPTsandbaggingтестирование моделей
Habr
RU

Погружаем модели в сказки русские, да рассказы древние – тестируем возможности Qwen и Whisper на дореволюционномъ

Хотите не забывать детали диалога или то, что вас просили купить в магазине? Конечно, можно по старинке открывать блокнот в телефоне или чат в избранн…

selectelраспознавание речиwhisperqwenasrтранскрибация речиавтоматическое распознавание речиискусственный интеллекттестирование моделей