ИИ-ассистент в дипломе: от прототипа до защищаемой ВКР с измеримым качеством
27 марта 2026 года МТС сообщила о запуске двух ИИ-сервисов для жителей Ямала — «ИИ-Ментора» (помощь в учёбе) и «ИИ-Генератора» (создание изображений). Для выпускника ИТ-специальности это не просто новость, а готовый полигон для ВКР: под капотом — большие языковые модели, RAG-контуры, диффузионные генераторы, оркестрация инференса и метрики качества. Такие кейсы защищать проще: есть реальный заказчик, понятная аудитория и измеримые требования. Ниже — как превратить этот сюжет в тему диплома, что положить в главы 1–3 и какие цифры показать комиссии, чтобы разговор шёл не о «модности ИИ», а об инженерии.
Частые вопросы до старта
Нужно ли обучать модель с нуля, или хватит RAG и промпт-инжиниринга?
С нуля — почти никогда: бюджет, данные и сроки ВКР не совместимы. Рабочая связка: открытая модель (Llama-класс, Qwen, Mistral) + RAG по корпусу учебных материалов + LoRA-дообучение на 1–2 тыс. пар «вопрос–ответ». В главе 1 обоснуйте выбор через сравнение: точность на валидации, стоимость инференса, требования к GPU.
Где брать датасет, если это закрытые учебные материалы?
Три законных источника: открытые банки задач (например, датасеты школьной и вузовской тематики), синтетические пары, сгенерированные сильной моделью и отфильтрованные вручную, и анонимизированные логи собственного прототипа. Обязательно опишите процедуру обезличивания и лицензии — это отдельный подраздел главы 2, за который часто дают дополнительные баллы.
Как оценивать генерацию изображений, если «нравится / не нравится» — не метрика?
Стандартный набор: FID (насколько распределение генераций близко к реальному корпусу), CLIPScore (соответствие промпту), плюс человеческая оценка по шкале MOS с межэкспертным согласием (коэффициент каппы Коэна). Для ВКР достаточно 100–200 промптов и трёх оценщиков — методика воспроизводима и защищаема.
Что важнее для комиссии: работающий прототип или глубокая теория?
Баланс. Комиссия любит связку «гипотеза → реализация → измерение». Прототип без метрик выглядит как хобби-проект, теория без кода — как реферат. Идеально: REST-сервис, скрипт оценки, таблица результатов до/после оптимизации.
Темы ВКР, которые вырастают из этого кейса
Тема 1. Разработка RAG-ассистента для сопровождения учебного процесса
- Актуальность: сервис «ИИ-Ментор» показывает рыночный запрос на персонализированную поддержку учащихся в удалённых регионах.
- Цель: спроектировать и реализовать ассистента с заземлением ответов на корпусе учебных материалов.
- Задачи: обзор архитектур RAG; выбор векторного хранилища (pgvector / FAISS / Qdrant); построение пайплайна индексации; оценка галлюцинаций и полноты ответов.
- Структура: Гл. 1 — анализ LLM-подходов и постановка требований; Гл. 2 — проектирование (C4-диаграммы) и реализация сервиса; Гл. 3 — тестирование, метрики ROUGE-L, Faithfulness, latency p95.
Тема 2. Сервис генерации изображений по текстовому описанию для образовательного контента
- Актуальность: «ИИ-Генератор» иллюстрирует спрос на быструю визуализацию учебных материалов без дизайнера.
- Цель: создать веб-сервис текстово-обусловленной генерации с контролем стиля и композиции.
- Задачи: сравнить диффузионные модели и подходы (SDXL, ControlNet, LoRA-адаптеры); реализовать очередь задач; измерить FID и CLIPScore; оценить стоимость генерации.
- Структура: Гл. 1 — теория диффузионных моделей и обзор аналогов; Гл. 2 — архитектура сервиса и реализация; Гл. 3 — эксперименты, MOS-оценка, оптимизация времени инференса.
Тема 3. Мониторинг и оценка качества ИИ-ассистентов в продуктивной среде
- Актуальность: запуск сервисов на уровне региона требует наблюдаемости — иначе деградация качества остаётся незамеченной.
- Цель: построить подсистему сбора метрик и алертинга для LLM-сервиса.
- Задачи: определить SLI/SLO; инструментировать пайплайн через OpenTelemetry; настроить дашборды; провести нагрузочное тестирование.
- Структура: Гл. 1 — анализ подходов к наблюдаемости ML-сервисов; Гл. 2 — проектирование телеметрии; Гл. 3 — эксперименты и расчёт TCO решения.
Как разложить материал статьи по главам
Глава 1: обоснование, а не пересказ новости
Не начинайте с «в современном мире растёт популярность ИИ». Начните с факта: 27 марта 2026 года сервисы стали доступны конкретной аудитории, значит, сформированы требования к доступности, языку интерфейса и нагрузке. Отсюда — функциональные и нефункциональные требования. Качество фиксируйте по ISO/IEC 25010: для ассистента критичны functional correctness, usability и performance efficiency, для генератора — ещё и reliability. Стадии создания системы удобно описать по ГОСТ 34.601-90, а документирование модуля — по ГОСТ 19.402-78.
Схемы этой главы: контекстная C4-диаграмма (уровень 1), диаграмма вариантов использования UML, сравнительная таблица моделей.
Глава 2: реализация и код, который видно
Минимальный жизнеспособный контур RAG-ассистента укладывается в 150–250 строк. Комиссии важно увидеть не объём, а структурность.
# Псевдокод RAG-контура с заземлением и логированием
def answer(query: str, top_k: int = 5) -> dict:
q_emb = embed(query) # эмбеддинг запроса
chunks = vector_store.search(q_emb, top_k) # pgvector / FAISS
if max_sim(chunks) < THRESHOLD:
return {"text": "Недостаточно данных", "sources": []}
prompt = build_prompt(query, chunks) # шаблон с цитированием
resp = llm.generate(prompt, max_tokens=512, temperature=0.2)
span.set_attribute("rag.chunks", len(chunks))
span.set_attribute("llm.tokens", resp.usage.total_tokens)
return {"text": resp.text, "sources": [c.id for c in chunks]}
Для генератора изображений отдельно опишите очередь задач и политику ретраев: диффузионный инференс — тяжёлая операция, и без асинхронной обработки HTTP-запросы отваливаются по таймауту. Здесь уместна BPMN-диаграмма процесса «запрос → постановка в очередь → генерация → постобработка → выдача результата».
Глава 3: метрики, которые защищают работу
| Компонент | Метрика | Как считать | Ориентир |
|---|---|---|---|
| RAG-ответы | ROUGE-L, Faithfulness | Сравнение с эталонными ответами | ROUGE-L ≥ 0.35 |
| Латентность LLM | p50 / p95, мс | OpenTelemetry-трейсы | p95 < 3000 мс |
| Генерация изображений | FID, CLIPScore | Батч из 200 промптов | CLIPScore ≥ 0.28 |
| Субъективное качество | MOS, каппа Коэна | 3 оценщика, шкала 1–5 | MOS ≥ 3.8 |
| Стоимость | TCO, руб./1000 запросов | GPU-часы + хранилище | Снижение ≥ 20% |
Отдельно пройдитесь по OWASP Top 10 for LLM Applications: prompt injection, утечка чувствительных данных, небезопасная обработка вывода. Один подраздел про защиту системного промпта и фильтрацию ответов заметно повышает прикладную ценность ВКР.
- Задачи в главах дословно совпадают с задачами во введении и выводами в заключении.
- Все рисунки и таблицы имеют подписи и ссылки в тексте.
- Схемы построены в единой нотации (C4 + UML), а не «как получилось».
- Метрики сопровождаются методикой измерения и объёмом выборки.
- Оформление соответствует ГОСТ 7.32 и требованиям вашей кафедры.
- Проверка на заимствования пройдена, корректные цитаты оформлены.
- Листинги кода вынесены в приложения, в тексте — только ключевые фрагменты.
- Нет базовой линии для сравнения. «Наша модель работает хорошо» — не результат. Сравнивайте минимум с двумя альтернативами: базовый промпт без RAG и внешний API-аналог сервисов из статьи.
- Оценка «на глазок». Один удачный пример генерации ничего не доказывает. Нужна выборка, методика и статистика разброса.
- Игнорирование стоимости. Региональный сервис живёт в рамках бюджета. Без расчёта TCO работа выглядит оторванной от реальности.
Источник: Ямальцы смогут использовать ИИ-ассистентов для учебы и создания изображений (опубликовано 2026-03-27)