AI-агенты в дипломе: как превратить тренд «цифровых коллег» в защищаемый проект по Data Engineering

Поддомен: Data Engineering / AI & ML
Роль: Data/ML-инженер

Введение: когда ты сам — датасет для своего робота-заменителя

Представьте: вас просят задокументировать каждый шаг вашей работы, чтобы ИИ мог её повторить. А потом — ещё и обучить этого агента на вашем стиле общения, привычках и даже пунктуации. Это не сценарий из «Чёрного зеркала» — это реальность китайских IT-специалистов в 2026 году. Как показала вирусная инициатива Colleague Skill, компании всё чаще просят сотрудников «дистиллировать» свои навыки, чтобы создавать AI-агентов. Это тревожит, но с точки зрения диплома — золотая жила. Почему? Потому что вы можете не просто описать тренд, а спроектировать систему, которая либо помогает, либо сопротивляется этой автоматизации. И это сразу делает вашу ВКР актуальной, технически насыщенной и защищаемой.

Темы ВКР: как превратить тревожный тренд в дипломный проект

Тема Актуальность Цель Задачи Структура
Проектирование системы дистилляции рабочих навыков с контролем приватности Реакция на тренд Colleague Skill: компании хотят автоматизировать работу, но сотрудники боятся утраты контроля над личными данными и стилем. Разработать архитектуру, позволяющую извлекать рабочие паттерны, но с защитой личной идентичности. 1. Проанализировать источники данных (Lark, DingTalk, почта, код).
2. Спроектировать ETL-пайплайн с анонимизацией.
3. Реализовать модель классификации «работа vs личность».
4. Оценить эффективность через метрики F1 и TCO.
Гл. 1 — Анализ AI-агентов и норм GDPR/ГОСТ Р 57580.
Гл. 2 — Проектирование пайплайна и схемы анонимизации.
Гл. 3 — Тестирование на синтетических данных, расчёт метрик.
Разработка анти-дистилляционного фильтра для защиты цифровой идентичности По аналогии с «анти-дистилляцией» Коки Сю: сотрудники хотят саботировать сбор данных, не нарушая трудовой дисциплины. Создать инструмент, который искажает выходные данные ETL-пайплайнов, снижая ценность для AI-агентов. 1. Изучить методы генерации шума в текстовых данных.
2. Реализовать фильтр на уровне API-интеграций.
3. Протестировать на OpenClaw-подобных агентах.
4. Оценить баланс между «полезностью» и «вредом».
Гл. 1 — Анализ угроз цифровой дистилляции.
Гл. 2 — Архитектура фильтра (C4-модель).
Гл. 3 — Тестирование, метрики: % снижения точности агента.
Оценка эффективности AI-агентов в автоматизации рутинных IT-задач Как показала практика, агенты пока не заменяют людей — но требуют контроля. Нужны метрики, чтобы оценить реальную пользу. Построить систему мониторинга, измеряющую производительность AI-агентов. 1. Определить KPI: время выполнения, % ошибок, потребление ресурсов.
2. Настроить сбор метрик через OpenTelemetry.
3. Визуализировать в Grafana.
4. Сравнить с ручным выполнением.
Гл. 1 — Анализ OpenClaw, Claude Code, ISO/IEC 25010.
Гл. 2 — Проектирование системы мониторинга.
Гл. 3 — Эксперимент, сравнение метрик.

Основная часть: как вписать тренд в структуру диплома

Глава 1: Теоретический анализ — не просто обзор, а аргументация

Здесь вы не просто описываете Colleague Skill — вы обосновываете проблему. Используйте:

Глава 2: Проектирование — покажите архитектуру, а не только текст

Ваша работа должна содержать не менее 3 схем. Вот что реально оценят на защите:

Пример фрагмента ETL-пайплайна на Python:

# Извлечение данных из DingTalk API с фильтрацией личных черт
import requests
import re

def extract_work_messages(token, user_id):
    headers = {"Authorization": f"Bearer {token}"}
    messages = requests.get(f"https://oapi.dingtalk.com/v1.0/chat/messages?userId={user_id}", headers=headers).json()
    
    # Убираем эмоции, личные реакции — только задачи и код
    filtered = []
    for msg in messages['data']:
        text = msg['content']
        if not re.search(r'(спасибо|грустно|давай обсудим|как ты думаешь)', text, re.I):
            filtered.append({
                "timestamp": msg['gmtCreate'],
                "task": extract_task_from_text(text),
                "code": extract_code_snippet(text)
            })
    return filtered

Глава 3: Тестирование — без метрик не будет защиты

Вы не можете сказать «система работает хорошо». Нужны цифры. Используйте:

Пример таблицы эффективности:

Метрика Ручной способ AI-агент (до фильтра) AI-агент (после фильтра)
Среднее время задачи (мин) 42 28 39
% ошибок 5 18 34
TCO за месяц (усл. ед.) 120 95 110

Инструменты, которые стоит использовать

Чему вы научитесь

Работая над таким проектом, вы освоите:

Типичные ошибки студентов

Ошибка 1: «Я просто опишу Colleague Skill»
Это не ВКР, это реферат. Вы должны предложить решение — либо улучшить систему, либо сопротивляться ей. Без реализации — нет защиты.

Ошибка 2: Нет метрик в главе 3
Студенты пишут: «агент работает». Экзаменатор спросит: «На сколько процентов быстрее? Сколько ошибок? Сколько это стоит?» — и если нет ответа, работа не пройдёт.

Ошибка 3: Схемы вставлены без пояснений
Диаграмма C4 должна быть описана в тексте: что на ней, какие компоненты, как данные передаются. Иначе — «картинка ради картинки».

FAQ: реальные вопросы студентов

Где взять данные для анализа, если я не работаю в компании?

Используйте синтетические данные. Сгенерируйте логи DingTalk/Lark через скрипты (например, на Python с faker). Это допустимо, если вы опишете метод генерации и ограничения. Также можно взять публичные датасеты чатов (например, Slack-логи из Kaggle) — но с анонимизацией.

Как оформить схемы по ГОСТ? Нужны ли подписи?

Да. Каждая схема — рисунок с подписью: «Рисунок 2.1 — C4-модель системы дистилляции навыков». Подпись снизу, выравнивание по центру. Нумерация сквозная по главе. Используйте PlantUML или Draw.io — экспортируйте в PNG с разрешением 300 dpi.

Можно ли использовать OpenClaw в дипломе, если он не открыт?

Да, но как аналог. Опишите его функции на основе публичной информации (как в статье MIT TR), а в реализации используйте открытые аналоги: например, LangChain + GPT-4o или Llama 3. Укажите: «моделирование работы OpenClaw».

Как доказать, что мой анти-фильтр эффективен?

Запустите эксперимент: сравните точность агента до и после фильтра. Используйте метрики: F1-score, accuracy. Добавьте примеры искажённых сообщений. Главное — покажите, что система снижает ценность данных для дистилляции, но не ломает рабочие процессы.

Чек-лист «Что проверить перед сдачей»

  • Соответствие задач в главе 1 — выводам в главе 3.
  • Все схемы подписаны, пронумерованы, есть ссылки в тексте.
  • Метрики эффективности рассчитаны (TCO, время, ошибки).
  • Упомянуты ГОСТ 34.19 и ISO/IEC 25010 в теоретической части.
  • Приложения содержат код, логи, схемы (в формате PDF или отдельные файлы).
  • Уникальность > 70% (без переписывания статьи!)
  • Ссылки на источник (включая эту статью) оформлены по ГОСТ Р 7.0.5–2008.

Нужна помощь с темой или реализацией? Наши специалисты помогут с выбором стека, проектированием архитектуры и подготовкой к защите — бесплатная консультация по любому из направлений: Data Engineering, AI, DevOps. В среднем, студенты тратят 120 часов на такую работу — мы поможем сэкономить время и избежать ошибок.

Материал подготовлен экспертами компании DiplomIT.ru. Мы помогаем студентам с 2010 года. Если вам нужна помощь в разработке темы или оформлении работы, наши специалисты готовы подсказать.

Последнее обновление: 2026-06-05

Источник: Chinese tech workers are starting to train their AI doubles–and pushing back (опубликовано 2026-04-20)