AI / ML
Cursor IDE — Best Practices
Практики работы с Cursor IDE: Rules для проекта и папок, режим Auto, MCP-серверы, декомпозиция задач и проверка изменений перед commit.
LLama.cpp AI LLM Engine — Как это работает
Как устроен инференс в llama.cpp: загрузка GGUF, токенизация, построение вычислительного графа, KV-cache и сэмплинг следующего токена.
LoRA — Дообучение AI LLM моделей
Дообучение LLM с помощью LoRA: чем подход отличается от RAG, как обучить адаптеры к gemma-3-4b на unsloth и peft и получить GGUF.
Offline AI Launcher — запуск AI LLM нейросетей на смартфоне
Приложение Offline AI Launcher: как запускать LLM Gemma, DeepSeek, Llama и Qwen прямо на Android из моделей .gguf, без интернета и подписки.
RAG (Retrieval-Augmented Generation), Function / Tools Calling, CAG (Cache-Augmented Generation) для LLM моделей
RAG, Function Calling и CAG для локальных LLM: как работает векторная база и примеры на Kotlin, Dspy, LangChain, LangChain4j и llama.cpp.
Векторные базы данных
Векторные базы на практике: чем отличаются Milvus, Qdrant и Weaviate, как считаются эмбеддинги, работают индексы HNSW и поиск по близости.
Нейросети простым языком
Как устроена LLM: токенизация, embedding, attention в трансформере, квантование и семплеры, которые определяют выбор следующего токена.
Техники промпт-инжиниринга для больших языковых моделей
Разделители, XML-теги, few-shot, псевдокод и иерархия правил: как форматировать промпты для ChatGPT, Claude и Gemini ради предсказуемого ответа.