AI-агенты в дипломе: как превратить тренд «цифровых коллег» в защищаемый проект по Data Engineering
Поддомен: Data Engineering / AI & ML
Роль: Data/ML-инженер
Введение: когда ты сам — датасет для своего робота-заменителя
Представьте: вас просят задокументировать каждый шаг вашей работы, чтобы ИИ мог её повторить. А потом — ещё и обучить этого агента на вашем стиле общения, привычках и даже пунктуации. Это не сценарий из «Чёрного зеркала» — это реальность китайских IT-специалистов в 2026 году. Как показала вирусная инициатива Colleague Skill, компании всё чаще просят сотрудников «дистиллировать» свои навыки, чтобы создавать AI-агентов. Это тревожит, но с точки зрения диплома — золотая жила. Почему? Потому что вы можете не просто описать тренд, а спроектировать систему, которая либо помогает, либо сопротивляется этой автоматизации. И это сразу делает вашу ВКР актуальной, технически насыщенной и защищаемой.
Темы ВКР: как превратить тревожный тренд в дипломный проект
| Тема | Актуальность | Цель | Задачи | Структура |
|---|---|---|---|---|
| Проектирование системы дистилляции рабочих навыков с контролем приватности | Реакция на тренд Colleague Skill: компании хотят автоматизировать работу, но сотрудники боятся утраты контроля над личными данными и стилем. | Разработать архитектуру, позволяющую извлекать рабочие паттерны, но с защитой личной идентичности. |
1. Проанализировать источники данных (Lark, DingTalk, почта, код). 2. Спроектировать ETL-пайплайн с анонимизацией. 3. Реализовать модель классификации «работа vs личность». 4. Оценить эффективность через метрики F1 и TCO. |
Гл. 1 — Анализ AI-агентов и норм GDPR/ГОСТ Р 57580. Гл. 2 — Проектирование пайплайна и схемы анонимизации. Гл. 3 — Тестирование на синтетических данных, расчёт метрик. |
| Разработка анти-дистилляционного фильтра для защиты цифровой идентичности | По аналогии с «анти-дистилляцией» Коки Сю: сотрудники хотят саботировать сбор данных, не нарушая трудовой дисциплины. | Создать инструмент, который искажает выходные данные ETL-пайплайнов, снижая ценность для AI-агентов. |
1. Изучить методы генерации шума в текстовых данных. 2. Реализовать фильтр на уровне API-интеграций. 3. Протестировать на OpenClaw-подобных агентах. 4. Оценить баланс между «полезностью» и «вредом». |
Гл. 1 — Анализ угроз цифровой дистилляции. Гл. 2 — Архитектура фильтра (C4-модель). Гл. 3 — Тестирование, метрики: % снижения точности агента. |
| Оценка эффективности AI-агентов в автоматизации рутинных IT-задач | Как показала практика, агенты пока не заменяют людей — но требуют контроля. Нужны метрики, чтобы оценить реальную пользу. | Построить систему мониторинга, измеряющую производительность AI-агентов. |
1. Определить KPI: время выполнения, % ошибок, потребление ресурсов. 2. Настроить сбор метрик через OpenTelemetry. 3. Визуализировать в Grafana. 4. Сравнить с ручным выполнением. |
Гл. 1 — Анализ OpenClaw, Claude Code, ISO/IEC 25010. Гл. 2 — Проектирование системы мониторинга. Гл. 3 — Эксперимент, сравнение метрик. |
Основная часть: как вписать тренд в структуру диплома
Глава 1: Теоретический анализ — не просто обзор, а аргументация
Здесь вы не просто описываете Colleague Skill — вы обосновываете проблему. Используйте:
- ГОСТ 34.19-2020 — для описания моделей жизненного цикла ПО (как автоматизация влияет на этапы разработки).
- ISO/IEC 25010 — примените к AI-агенту: какие характеристики качества страдают (например, «сохраняемость» при смене сотрудника)?
- Анализ источников данных: Lark, DingTalk — это не просто мессенджеры, это хранилища поведенческих данных. Опишите их API, форматы данных, уровни доступа.
Глава 2: Проектирование — покажите архитектуру, а не только текст
Ваша работа должна содержать не менее 3 схем. Вот что реально оценят на защите:
- C4-модель — покажите контекст (система дистилляции), контейнеры (ETL, фильтр, AI-агент), компоненты.
- BPMN-диаграмма — процесс «от сбора данных до генерации навыка».
- UML-диаграмма классов — структура данных: Employee, Skill, CommunicationPattern, AnonymizationRule.
Пример фрагмента ETL-пайплайна на Python:
# Извлечение данных из DingTalk API с фильтрацией личных черт
import requests
import re
def extract_work_messages(token, user_id):
headers = {"Authorization": f"Bearer {token}"}
messages = requests.get(f"https://oapi.dingtalk.com/v1.0/chat/messages?userId={user_id}", headers=headers).json()
# Убираем эмоции, личные реакции — только задачи и код
filtered = []
for msg in messages['data']:
text = msg['content']
if not re.search(r'(спасибо|грустно|давай обсудим|как ты думаешь)', text, re.I):
filtered.append({
"timestamp": msg['gmtCreate'],
"task": extract_task_from_text(text),
"code": extract_code_snippet(text)
})
return filtered
Глава 3: Тестирование — без метрик не будет защиты
Вы не можете сказать «система работает хорошо». Нужны цифры. Используйте:
- TCO (Total Cost of Ownership) — сравните стоимость ручной поддержки задач vs. использование AI-агента + надзор.
- Точность агента (Precision/Recall) — сколько задач выполнено без ошибок?
- Время выполнения — насколько быстрее агент?
- Метрика «уникальности стиля» — если вы делаете анти-дистилляцию, измерьте, насколько снизилась идентифицируемость сотрудника (например, через NLP-сравнение стиля).
Пример таблицы эффективности:
| Метрика | Ручной способ | AI-агент (до фильтра) | AI-агент (после фильтра) |
|---|---|---|---|
| Среднее время задачи (мин) | 42 | 28 | 39 |
| % ошибок | 5 | 18 | 34 |
| TCO за месяц (усл. ед.) | 120 | 95 | 110 |
Инструменты, которые стоит использовать
- OpenTelemetry — для сбора метрик производительности.
- LangChain / LlamaIndex — если вы моделируете работу агента.
- Apache Airflow — для оркестрации ETL-процессов.
- FastAPI — реализация анти-фильтра как микросервиса.
- Grafana + Prometheus — визуализация.
Чему вы научитесь
Работая над таким проектом, вы освоите:
- Проектирование ETL-пайплайнов с учётом этики и приватности.
- Использование C4 и UML для документирования архитектуры.
- Настройку мониторинга AI-систем через OpenTelemetry.
- Расчёт TCO и других бизнес-метрик.
- Оформление глав по ГОСТ 34.19 и включение диаграмм в приложения.
Типичные ошибки студентов
Ошибка 1: «Я просто опишу Colleague Skill»
Это не ВКР, это реферат. Вы должны предложить решение — либо улучшить систему, либо сопротивляться ей. Без реализации — нет защиты.
Ошибка 2: Нет метрик в главе 3
Студенты пишут: «агент работает». Экзаменатор спросит: «На сколько процентов быстрее? Сколько ошибок? Сколько это стоит?» — и если нет ответа, работа не пройдёт.
Ошибка 3: Схемы вставлены без пояснений
Диаграмма C4 должна быть описана в тексте: что на ней, какие компоненты, как данные передаются. Иначе — «картинка ради картинки».
FAQ: реальные вопросы студентов
Где взять данные для анализа, если я не работаю в компании?
Используйте синтетические данные. Сгенерируйте логи DingTalk/Lark через скрипты (например, на Python с faker). Это допустимо, если вы опишете метод генерации и ограничения. Также можно взять публичные датасеты чатов (например, Slack-логи из Kaggle) — но с анонимизацией.
Как оформить схемы по ГОСТ? Нужны ли подписи?
Да. Каждая схема — рисунок с подписью: «Рисунок 2.1 — C4-модель системы дистилляции навыков». Подпись снизу, выравнивание по центру. Нумерация сквозная по главе. Используйте PlantUML или Draw.io — экспортируйте в PNG с разрешением 300 dpi.
Можно ли использовать OpenClaw в дипломе, если он не открыт?
Да, но как аналог. Опишите его функции на основе публичной информации (как в статье MIT TR), а в реализации используйте открытые аналоги: например, LangChain + GPT-4o или Llama 3. Укажите: «моделирование работы OpenClaw».
Как доказать, что мой анти-фильтр эффективен?
Запустите эксперимент: сравните точность агента до и после фильтра. Используйте метрики: F1-score, accuracy. Добавьте примеры искажённых сообщений. Главное — покажите, что система снижает ценность данных для дистилляции, но не ломает рабочие процессы.
Чек-лист «Что проверить перед сдачей»
- Соответствие задач в главе 1 — выводам в главе 3.
- Все схемы подписаны, пронумерованы, есть ссылки в тексте.
- Метрики эффективности рассчитаны (TCO, время, ошибки).
- Упомянуты ГОСТ 34.19 и ISO/IEC 25010 в теоретической части.
- Приложения содержат код, логи, схемы (в формате PDF или отдельные файлы).
- Уникальность > 70% (без переписывания статьи!)
- Ссылки на источник (включая эту статью) оформлены по ГОСТ Р 7.0.5–2008.
Нужна помощь с темой или реализацией? Наши специалисты помогут с выбором стека, проектированием архитектуры и подготовкой к защите — бесплатная консультация по любому из направлений: Data Engineering, AI, DevOps. В среднем, студенты тратят 120 часов на такую работу — мы поможем сэкономить время и избежать ошибок.
Источник: Chinese tech workers are starting to train their AI doubles–and pushing back (опубликовано 2026-04-20)