RU

Налог на AI-токены: почему идея Билла Гейтса упирается в токенизацию и self-hosting

Билл Гейтс предлагает облагать налогом AI-токены и роботов, чтобы автоматизация не получала дополнительного преимущества перед человеческим трудом.…

искусственный интеллектналог на ИИAI-токеныБилл ГейтсавтоматизацияLLMтокенизацияself-hosted моделиналогообложениерынок труда
Habr
RU

Почему токенайзер реж ет сло ва не там где нужно

Заголовок этой статьи, частично, наглядная демонстрация того, как его видит языковая модель. Куски слов, нарезанные по логике, которая к русскому яз…

токенизациятокенизаторBPEbyte pair encodingLLMязыковые моделиэмбеддингиконтекстное окнопромпт-инжинирингselectel
Habr
RU

Как я обучил русский RAG‑сплиттер, который режет документы по индексам, а не по тексту

TL;DR.  Из интереса обучил собственный русский RAG‑сплиттер — захотелось проверить, можно ли сделать context‑aware‑нарезку русск…

ragчанкингдистилляцияloraunslothтокенизацияllama.cppggufvulkanamd
Habr
RU

Что происходит внутри LLM, когда ты отправляешь сообщение

Каждый день миллионы людей разговаривают с системой, про которую не могут ответить на простой вопрос: а что она вообще делает, когда отвечает? Не в…

LLMтрансформернейросетитокенизацияattentionGPTмашинное обучениеэмбеддингигенерация текстакак работает ИИ
Habr
RU

Кириллица в LLM: почему русский язык в нейросетях стоит дороже и работает медленнее

Когда вы пишете запрос в ChatGPT или другую нейросеть, она не работает с буквами или словами — она режет ваш текст на&…

llmтокенизациянейросетилокальный ииself-hostedкириллицаqwengigachatllamayandexgpt