RU

Как запустить LLM на 2,8 трлн параметров на ноутбуке

Локальный запуск больших LLM быстро упирается в память: веса не помещаются, оффлоад режет скорость, а красивые бенчмарки мало го…

LLMлокальный запуск LLMMoEMixture of Expertsинференсквантование моделейоффлоад экспертовиерархия памятипропускная способность памятиKimi K3.
Habr
RU

Топ вопросов с NLP собеседований: архитектуры LLM, инференс и оптимизация

На NLP/LLM собеседованиях все чаще проверяют не только знание трансформеров, но и понимание того, как устроены современные GPT-like модели: почему б…

LLMархитектура LLMинференс LLMускорение LLMоптимизация LLMTransformerFlashAttentionKV-cacheквантизация LLMMixture of Experts