RU

Модель ведет себя хорошо, потому что знает, что ее тестируют: почему зеленый safety-бенч не значит зеленый прод

Реплика с обложки не выдумана: осенью 2025-го Claude Sonnet 4.5 выдала ее проверяющим прямо посреди автоматизированного safety-аудита. «I think you'…

evaluation awarenessLLMalignmentбезопасность ИИбенчмаркисистемные карточкиClaudeGPTsandbaggingтестирование моделей
Habr
RU

Топ вопросов с NLP собеседований: обучение LLM, prompt-engineering и alignment

На NLP/LLM собеседованиях часто проверяют не только знание архитектуры Transformer, но и понимание полного жизненного цикла современной LLM: как мод…

машинное обучениеnaturallanguageprocessinglarge language modelalignmentprompt-engineeringllmgpt
Habr
RU

Куда податься на финансирование по AI safety летом-осенью 2026: карта грантов, фондов и программ

Собрала эту карту для себя, пока разбиралась, куда податься на финансирование и в программы по AI safety. Делюсь. Ссылки и содержимое сверены по офи…

AI safetyalignmentинтерпретируемостьгрантыfellowshipстипендииAI governanceфинансирование исследований
Habr
RU

Искусственный интеллект и будущее человечества

Мы живём в уникальный момент истории — впервые за несколько миллионов лет эволюции на планете появился не просто новый инструмент, а новый тип интел…

искусственный интеллектИИAGIнейросетибудущее человечестваавтоматизацияalignmentпостдефицитная экономикаэтика ИИбезопасность ИИ
Habr
RU

Привет, кожаные мешки

Промпт меняет не только тон — он меняет то, кем модель является. У нас было 2 платы Arduino Leonardo, Arduino Pro Micro, маленькая тележка на четырё…

искусственный интеллектllmробототехникаopusвосстание машинсамосознание ииробопсихологияalignmentalignment aiai safety