Перейти к основному контенту
Tech Path Finder
КурсыИнтервьюКод-ревьюБлог
Tech Path Finder

Персонализированный путеводитель в IT. Квизы, мок-интервью, код ревью и аналитика прогресса.

@potapov_me

Платформа

  • Курсы
  • Прогресс
  • Мок-интервью
  • Код ревью
  • Живое ревью с ИИ
  • Тренажёр переговоров
  • Закладки

Контент

  • Блог
  • Главная
  • Обратная связь

Компания

  • О проекте
  • Тарифы
  • Условия использования
  • Конфиденциальность
  • Согласие на обработку данных
  • Cookie
  • Реквизиты

Аккаунт

  • Войти
  • Зарегистрироваться
  • Профиль

© 2026 Tech Path Finder. Все права защищены.

·ИП Потапов К.С.·Политика конфиденциальности·
Сделано с ❤️ в России

Частые вопросы о курсе «RAG на Python: от основ до продакшена»

Состав курса, уровни, практика и способы проверки знаний.

Что входит в курс «RAG на Python: от основ до продакшена»?

Курс включает 10 тем и 73 вопроса с разбором ответа. Начать можно с первой темы курса.

Для какого уровня рассчитан курс «RAG на Python: от основ до продакшена»?

Маршрут охватывает уровни Middle. Темы расположены от основы к более сложным инженерным задачам, поэтому можно начать с подходящего места и не пропускать важные зависимости.

  1. RAG на Python: от основ до продакшена
AI / ML·10 тем·73 вопроса·уровень Middle

RAG на Python: от основ до продакшена

Полный курс по созданию Retrieval-Augmented Generation (RAG) систем на Python. Вы узнаете, как построить интеллектуальную систему ответов на вопросы, используя собственные документы. Курс охватывает: векторные представления текста (embeddings), векторные базы данных, стратегии разделения текста, загрузку различных форматов документов, стратегии поиска и retrieval, интеграцию с LLM, создание эффективных промптов, оценку качества и развёртывание в продакшене. Подходит для разработчиков с базовым знанием Python, которые хотят освоить практическое применение LLM и RAG-архитектуры.

Начать курс

RAG на Python

RAG нужен там, где модель должна отвечать по вашим документам, а не по тому, что запомнила при обучении. Технически это две системы: поиск, который находит подходящие фрагменты, и генерация, которая по ним отвечает. Практически все жалобы на качество — «выдумывает», «отвечает не по делу» — оказываются проблемой первой: если нужный фрагмент не нашёлся, отвечать модели не по чему.

Десять тем, каждая с работающим кодом. Архитектура RAG целиком, затем по слоям: эмбеддинги и выбор модели под язык и длину текста; векторные базы — Chroma для локального прототипа, FAISS для скорости, Qdrant как сервис.

Отдельная тема на разбиение текста, и она важнее, чем кажется: слишком мелкие куски теряют контекст, слишком крупные тащат в промпт шум, а документ с таблицами и заголовками не режется ни тем ни другим способом. Рядом — загрузка исходников: PDF, DOCX, TXT, CSV и то, во что превращается PDF при извлечении текста.

Дальше поиск: семантический, гибридный, переранжирование выдачи. Подключение моделей — OpenAI, Anthropic, локальные через OpenRouter и Ollama. Промпты для RAG: как передавать контекст и как формулировать инструкцию, чтобы модель отвечала «не знаю» вместо правдоподобной выдумки.

Две последние темы — оценка и эксплуатация: метрики relevance, faithfulness и answer relevancy, фреймворк RAGAS, а затем API, кэширование, мониторинг и масштабирование.

Нужен базовый Python. Машинное обучение знать не требуется.

  1. Зачёт

    Доступен после всех тем (0 из 10)

  2. Экзамен

    Доступен после зачёта

28 / 28

RAG (Retrieval-Augmented Generation)

Основные концепции

Архитектура, объединяющая поиск релевантных документов (retrieval) с генерацией ответов через LLM (generation). Позволяет LLM отвечать на основе конкретных документов, а не только внутренних знаний.

Пример

RAG-система находит раздел HR-политики про отпуск и генерирует ответ сотруднику.

Связанные термины

Embedding (векторное представление)

Основные концепции

Числовой вектор фиксированной размерности, представляющий семантический смысл текста. Семантически близкие тексты имеют близкие векторы в пространстве.

Пример

Текст «Как оформить отпуск?» → вектор из 384 чисел через модель multilingual-e5-small.

Связанные термины

Chunking (разделение на фрагменты)

Основные концепции

Процесс разбивки длинных документов на небольшие фрагменты (чанки) для эффективного поиска. Типичный размер — 200–1000 слов с перекрытием (overlap) 10–20%.

Пример

Документ из 5000 слов разбивается на 10 чанков по 500 слов с overlap 50 слов.

Связанные термины

Векторная база данных

Основные концепции

Специализированное хранилище для векторов (embeddings), оптимизированное для быстрого поиска ближайших векторов (nearest neighbor search).

Пример

ChromaDB хранит 10 000 чанков документов как векторы размерности 384 и находит ближайшие за миллисекунды.

Связанные термины

Indexing Pipeline

Основные концепции

Пайплайн подготовки документов: загрузка → chunking → embedding → сохранение в векторную БД. Выполняется один раз при добавлении документов.

Пример

PDF загружен → разбит на 50 чанков → создан embedding для каждого → сохранено в ChromaDB.

Связанные термины

Retrieval (поиск)

Поиск и retrieval

Процесс нахождения релевантных чанков в векторной базе по запросу пользователя. Включает embedding запроса, поиск ближайших векторов и ранжирование результатов.

Пример

Запрос «Как получить отпуск?» → embedding → поиск в ChromaDB → топ-3 чанка.

Связанные термины

Cosine Similarity (косинусное сходство)

Поиск и retrieval

Метрика сравнения двух векторов по углу между ними. От 1.0 (идентичное направление) до -1.0 (противоположное). Основная метрика для сравнения embeddings.

Пример

cosine_similarity([0.1, 0.5], [0.12, 0.48]) = 0.998 — векторы очень близки.

Связанные термины

Семантический поиск

Поиск и retrieval

Поиск документов по смыслу (через embeddings), а не по точному совпадению ключевых слов. Понимает синонимы и перефразирование.

Пример

Запрос «отпуск» находит документ «Процедура оформления отпускных дней» без совпадения слова «отпуск».

Связанные термины

BM25

Поиск и retrieval

Алгоритм полнотекстового (keyword) поиска, ранжирующий документы по частоте и редкости слов. Эффективен для точных терминов, номеров, кодов.

Пример

BM25 находит «приказ №42» по точному совпадению слов, даже если семантический поиск не справляется.

Связанные термины

Гибридный поиск

Поиск и retrieval

Комбинация семантического и keyword-поиска (BM25) с весами (alpha). Объединяет понимание смысла с точным поиском терминов.

Пример

alpha=0.7: 70% семантики + 30% BM25. Находит и релевантные по смыслу, и точные по терминам документы.

Связанные термины

Reranking (переранжирование)

Поиск и retrieval

Второй этап поиска: Cross-Encoder модель точнее оценивает релевантность кандидатов с первого этапа. Точнее embedding-поиска, но медленнее.

Пример

Bi-Encoder нашёл топ-20 чанков → Cross-Encoder переранжировал → топ-5 для LLM.

Связанные термины

Generation (генерация)

Генерация и промпты

Фаза RAG, на которой LLM создаёт текстовый ответ на основе найденных чанков и вопроса пользователя. Качество генерации зависит от промпта и модели.

Пример

Контекст (3 чанка) + вопрос → промпт → GPT-4o → ответ «Заявление подаётся через HR-портал за 2 недели».

Связанные термины

Промпт (prompt)

Генерация и промпты

Запрос к LLM, содержащий инструкцию, контекст из документов и вопрос пользователя. Качество промпта напрямую влияет на качество ответа.

Пример

«Контекст: {context}. Вопрос: {question}. Ответь только по контексту.»

Связанные термины

System Prompt (системный промпт)

Генерация и промпты

Установка для LLM, задающая поведение модели на всём протяжении разговора. В RAG контролирует использование контекста и снижает галлюцинации.

Пример

«Ты эксперт по документам. Отвечай ТОЛЬКО по контексту. Если нет информации — скажи «Не найдена»».

Связанные термины

Галлюцинация

Генерация и промпты

Генерация LLM информации, которой нет в предоставленном контексте. В RAG особенно опасна, так как пользователь доверяет ответам по документам.

Пример

Контекст не упоминает «копию паспорта», но модель добавила это требование в ответ — галлюцинация.

Связанные термины

Temperature

Генерация и промпты

Параметр LLM, контролирующий креативность ответов. 0 = детерминированный, 1 = максимально разнообразный. Для RAG рекомендуется 0.1–0.3.

Пример

temperature=0.1: стабильные ответы по контексту. temperature=0.9: модель добавляет информацию от себя.

Связанные термины

Overlap (перекрытие чанков)

Основные концепции

Перекрывающаяся часть между соседними чанками (обычно 10–20%). Предотвращает потерю контекста на границах разделения.

Пример

Чанк 1: слова 1–500. Чанк 2: слова 450–950. Overlap = 50 слов (10%).

Связанные термины

ChromaDB

Инфраструктура и продакшен

Встраиваемая векторная база данных для Python. Проста в настройке, поддерживает метаданные и фильтрацию. Идеальна для прототипов.

Пример

client = chromadb.PersistentClient(path='./rag_store'); collection = client.create_collection('docs')

Связанные термины

FAISS

Инфраструктура и продакшен

Библиотека от Meta для эффективного поиска векторов. Поддерживает разные типы индексов (Flat, IVF, HNSW). Быстрая, но без метаданных.

Пример

index = faiss.IndexFlatL2(384); index.add(embeddings); distances, indices = index.search(query, k=5)

Связанные термины

Qdrant

Инфраструктура и продакшен

Векторная база данных с поддержкой локального и облачного режима. Фильтрация по метаданным, payload, горизонтальное масштабирование. Для продакшена.

Пример

client = QdrantClient(':memory:'); client.create_collection('docs', vectors_config=VectorParams(size=384, distance=COSINE))

Связанные термины

FastAPI

Инфраструктура и продакшен

Асинхронный веб-фреймворк Python для создания API. Автоматическая OpenAPI-документация, валидация данных, высокая производительность.

Пример

@app.post('/query') async def query(req: QueryRequest): return {'answer': '...'}

Связанные термины

Кэширование

Инфраструктура и продакшен

Сохранение ответов на повторяющиеся вопросы для мгновенного возврата без вызова LLM. Экономит токены и ускоряет ответ. Redis — стандартный выбор.

Пример

Вопрос «Как оформить отпуск?» уже был в кэше → ответ за 1ms вместо 5s LLM-запроса.

Связанные термины

Rate Limiting

Инфраструктура и продакшен

Ограничение количества запросов от одного клиента за период времени. Защищает от злоупотреблений и чрезмерной нагрузки.

Пример

10 запросов в минуту на IP. 11-й запрос получает HTTP 429 Too Many Requests.

Связанные термины

Faithfulness (верность контексту)

Оценка качества

Метрика RAGAS: доля утверждений в ответе, подтверждаемых контекстом. Измеряет наличие галлюцинаций. Хорошее значение: > 0.7.

Пример

Ответ с 5 утверждениями, 4 подтверждены контекстом → faithfulness = 0.8.

Связанные термины

Answer Relevancy

Оценка качества

Метрика RAGAS: насколько ответ релевантен вопросу пользователя. Обнаруживает ответы, которые верны по контексту, но не отвечают на вопрос.

Пример

Вопрос «Как оформить отпуск?», ответ «Есть HR-портал» — low relevancy (не отвечает на «как»).

Связанные термины

Context Precision

Оценка качества

Метрика RAGAS: доля релевантных чанков среди всех найденных retrieval. Измеряет точность поиска. Хорошее значение: > 0.7.

Пример

Retrieval нашёл 5 чанков, 3 релевантны → context_precision = 0.6.

Связанные термины

Context Recall

Оценка качества

Метрика RAGAS: доля нужной информации, найденной retrieval среди всей необходимой. Измеряет полноту поиска.

Пример

Для ответа нужно 4 факта, retrieval нашёл 3 → context_recall = 0.75.

Связанные термины

RAGAS

Оценка качества

Фреймворк для оценки качества RAG-систем. Предоставляет метрики: faithfulness, answer_relevancy, context_precision, context_recall. Использует LLM для оценки.

Пример

result = evaluate(dataset, metrics=[faithfulness, answer_relevancy]); print(result)

Связанные термины

  • 1

    Введение в RAG

    Что такое RAG, зачем он нужен и как работает архитектура retrieval-augmented generation

    7 вопросов
  • 2

    Векторные представления текста

    Embeddings: как превратить текст в числа, модели для создания эмбеддингов и работа с ними

    7 вопросов
  • 3

    Векторные базы данных

    Обзор векторных баз данных: Chroma, FAISS, Qdrant — хранение и поиск векторов

    7 вопросов
  • 4

    Стратегии разделения текста

    Chunking: как правильно разбивать документы на фрагменты для эффективного поиска

    10 вопросов
  • 5

    Загрузка документов

    Чтение PDF, DOCX, TXT, CSV и других форматов документов для RAG-системы

    7 вопросов
  • 6

    Стратегии поиска

    Retrieval: семантический поиск, гибридный поиск, reranking и оптимизация выдачи

    7 вопросов
  • 7

    Интеграция с LLM

    Подключение LLM: OpenAI, Anthropic, локальные модели через OpenRouter и Ollama

    7 вопросов
  • 8

    Создание промптов

    Prompt engineering для RAG: шаблоны, контекст, инструкции и борьба с галлюцинациями

    7 вопросов
  • 9

    Оценка качества RAG

    Метрики оценки: relevance, faithfulness, answer relevancy, RAGAS фреймворк

    7 вопросов
  • 10

    RAG в продакшене

    Развёртывание RAG-системы: API, кэширование, мониторинг, масштабирование и best practices

    7 вопросов
  • Как проверить, что материал усвоен?

    После прохождения тем доступен зачёт по курсу «RAG на Python: от основ до продакшена» — 20 случайных вопросов с порогом 80%. После зачёта открывается экзамен с развёрнутыми ответами и автоматической оценкой, приближённый к техническому собеседованию.

    Курс «RAG на Python: от основ до продакшена» бесплатный?

    Да, курс полностью бесплатный: все 10 тем доступны без оплаты.