Рубрики
Технологии

Топ вопросов с NLP собеседований: архитектуры LLM, инференс и оптимизация

На NLP/LLM собеседованиях все чаще проверяют не только знание трансформеров, но и понимание того, как устроены современные GPT-like модели: почему большинство генеративных LLM используют decoder-only архитектуру, чем LLaMA отличается от ванильного Transformer, зачем нужны RoPE, RMSNorm, SwiGLU и GQA. Почему инференс LLM дорогой и какие оптимизации помогают его ускорять: fused kernels, FlashAttention, KV-cache и PagedAttention, […]

Рубрики
Технологии

Пост @KastorTroy — Java (+1) — N/P

Инференс трансформеров на чистой Java без Python и JNI Запуск нейросетей на Java часто воспринимается как компромисс: либо JNI-обвязки, либо Python-стек, либо готовые рантаймы. Но современные JDK уже позволяют строить полноценный пайплайн инференса внутри JVM — без Python, без JNI-слоя и без лишней магии. Хочу провести технический вебинар и показать, как на чистой Java реализовать […]

Рубрики
Технологии

Пост @MaxRokatansky — Блог компании OTUS (+3) — N/P

Выберите, что прокачать: открытые уроки для IT-специалистов на неделю Новая неделя — хороший повод закрыть конкретный пробел в знаниях, разобраться с рабочей задачей или попробовать направление, к которому давно присматривались. Собрали открытые уроки по категориям, чтобы вы могли быстро найти подходящую тему. Инфраструктура, DevOps и безопасность 27 июля в 20:00 — «K8S + Vault — […]

Рубрики
Технологии

Финальный босс лингвистики: как я собрал полный NLP-стек для кабардинского из старых словарей

Привет, Хабр! Меня зовут Эдуард. В прошлой статье я рассказывал про локальный переводчик и синтез голоса на кабардинском. С тех пор проект вырос: я делаю приложение на iOS для чтения с синтезом и распознаванием речи на кабардинском и ещё паре десятков «обделённых» языков. Чтобы приложение было умным (ранжировало важные предложения, искало по смыслу, вело чат по книге, […]

Рубрики
Технологии

Топ вопросов по LLM: стратегии генерации текста и метрики оценки LLM

На NLP/LLM-собеседованиях часто проверяют не то, знаешь ли ты слова top-k, top-p и BLEU, а понимаешь ли ты, что происходит с распределением вероятностей, почему greedy decoding зацикливается, зачем нужна temperature и почему BLEU плохо оценивает ответы современных LLM. В этой статье — чеклист по языковому моделированию, стратегиям генерации и метрикам качества. Это не полноценная лекция […]

Рубрики
Технологии

VK и МФТИ открыли набор на магистерскую программу «Искусственный интеллект и социальные медиа»

Платформа VK Education и Физтех‑школа прикладной математики и информатики МФТИ запускают магистерскую программу «Искусственный интеллект и социальные медиа». Обучение направлено на подготовку специалистов по анализу данных и разработке интеллектуальных систем. Подать заявку можно до 8 июля 2026 года. Подробности о программе и этапах отбора доступны на сайте. «Искусственный интеллект и социальные медиа» будет готовить исследователей в области искусственного интеллекта, ML-нженеров и […]

Рубрики
Технологии

Современные морфоанализаторы русского языка: от словарей к нейросетям

В статье «Извлечение и обработка требований из документов с помощью NLP-инструментов» я уже показывал, как переход от LLM к NLP-библиотекам помогает ускорить обработку текста. Это, конечно, не значит, что нужно совсем отказываться от LLM — они незаменимы для генерации текста и сложных рассуждений. Но чтобы определить, что «кошками» — это творительный падеж множественного числа существительного […]

Рубрики
Технологии

Кастомный пайплайн BERTopic: как кластеризовать тексты и получить интерпретируемые темы с помощью LLM

Привет, Хабр! Меня зовут Антон и я занимаюсь задачами NLP в компании Ростелеком Информационные технологии. Если вам приходилось разбирать большие массивы текстов: отзывов, обращений в поддержку или комментариев, то вы знаете, насколько это трудоемкий процесс. В статье я покажу, как автоматизировать этот процесс с помощью пайплайна BERTopic: от эмбеддингов и кластеризации до интерпретации тем. Особое […]

Рубрики
Технологии

AI для PHP-разработчиков. Часть 6: Bag of Words и TF–IDF – как компьютер превращает текст в математику

Когда мы говорим, что нейросети «понимают текст», легко забыть: компьютер изначально вообще не понимает слова. Для него текст – это набор чисел, статистики и векторов. В этой статье разберём Bag of Words и TF–IDF – фундаментальные подходы, с которых начинались NLP, поисковые системы и анализ текста. А заодно реализуем поиск похожих документов на чистом PHP […]

Рубрики
Технологии

C помощью Python нашел следы Шекспира в песне Цоя

Даже беглый анализ некоторых текстов группы «Кино» наталкивает на мысль о довольно сильных символических значениях их стихотворных строк. Мне стало интересно провести сравнительный анализ текста песни Виктора Цоя и драмы Уильяма Шекспира «Гамлет» и найти пересечения, аллюзии и реминисценции в творчестве двух авторов помощью инструментов NLP на Python.