RU

Как переводить смешанный русский-казахский и не сойти с ума

В Казахстане часто смешивают казахский и русский в соцсетях, переписке, быту. Но попробуйте скормить русско-казахскую фразу любой системе машинного…

SimAlignдатасетыдатасеты обучениямашинный переводязыковые моделиllmказахский языкnlpисследованиясинтетические данные
Habr
RU

Как переводить смешанный русский-казахский и не сойти с ума

В Казахстане часто смешивают казахский и русский в соцсетях, переписке, быту. Но попробуйте скормить русско-казахскую фразу любой системе машинного…

SimAlignдатасетыдатасеты обучениямашинный переводязыковые моделиllmказахский языкnlpисследованиясинтетические данные
Habr
RU

Кто такие синтетические покупатели и почему они меняют e-commerce

Электронная коммерция долго училась понимать покупателя через данные: что человек искал, на какие карточки нажимал, где бросал корзину, как реагиров…

промптысинтетические данныеэлектронная коммерциямаркетплейсыискусственный интеллект
Habr
RU

Коммуналка, школа и 10 лет свободы: AI выпустили в симулятор жизни, где они научились дружить, выгорать и достигать

Представьте The Sims, в котором вам навсегда отключили мышь, а «симами» теперь управляет не примитивный игровой скрипт, а современные LLM. Вы парите…

ииaiсимуляция жизнисимуляцияисследованиеисскуственный интеллектмаслоусинтетические данные
Habr
RU

YOLOv8 против OpenCV на чертежах метро: почему простая геометрия победила нейросеть

Как я случайно сделал утечку данных и решил задачу в пользу OpenCV. Задача — детекция основной надписи (штампа) на чертежах для оцифровки в BIM. Дан…

yolov8opencvгостpythonдетекция объектовсинтетические данныекомпьютерное зрениеisoчертеж
Habr
RU

Трудности перевода: почему LLM не умеют писать нормальные докстринги на русском и как это исправить

Каждый, кто пробовал заставить кодинг-LLM написать вменяемый комментарий к коду на русском, знает, какая это боль. Часто модели либо срываются на ан…

датасеткомментарии к кодуdocstringsавтоматизация разработкиискусственный интеллектllmобучение моделейнаучные исследованиясинтетические данныеai
Habr
RU

Трудности перевода: почему LLM не умеют писать нормальные докстринги на русском и как это исправить

Каждый, кто пробовал заставить кодинг-LLM написать вменяемый комментарий к коду на русском, знает, какая это боль. Часто модели либо срываются на ан…

датасеткомментарии к кодуdocstringsавтоматизация разработкиискусственный интеллектllmобучение моделейнаучные исследованиясинтетические данныеai