ИИ меняет требования к сотрудникам: что взять в диплом по машинному обучению
Новость о том, что «Авито Работа» и Alfa Tech пересматривают требования к персоналу из-за активного внедрения ИИ, — не просто инфоповод. Это готовый практический кейс для вашей выпускной квалификационной работы. Искусственный интеллект уже сейчас автоматизирует анализ резюме, извлечение навыков и даже прогнозирование востребованности компетенций. В дипломе по направлению «Data Science» или «Прикладная информатика» вы можете построить модель, которая делает нечто подобное. Ниже разберём, как именно превратить эту новость в полноценную ВКР, какие главы написать, какую модель выбрать и как защититься перед комиссией без лишней боли.
Частые вопросы (FAQ)
Сложно ли писать ВКР по машинному обучению, если не было углублённого курса?
Базовых знаний Python и библиотек sklearn достаточно для уровня «хорошая студенческая работа». Не нужно обучать GPT с нуля — берите готовые алгоритмы: TF-IDF, логистическую регрессию или Random Forest. Всё это разбирается в вузовском курсе. Главное — правильно сформулировать задачу и получить стабильные метрики.
Где взять данные о вакансиях и резюме для обучения модели?
Для учебного проекта подойдут открытые источники: HeadHunter API (нужен токен), датасеты с Kaggle («Job postings», «LinkedIn Job Listings»), а также синтетические данные, сгенерированные по вакансиям с Habr Карьеры или hh.ru. Если тема касается резюме — можно собрать небольшой корпус вручную (100–200 примеров) и разметить тэгами навыков. Для ВКР этого достаточно, чтобы продемонстрировать работу модели.
Какие требования вуза к оформлению кода, схемам и диаграммам?
Код обычно выносят в приложение или вставляют фрагменты в главу 2. Обязательны комментарии, осмысленные имена переменных и краткое описание алгоритма. Схемы выполняются в UML или C4 — в зависимости от методички. Для систем с ML рекомендуется строить диаграмму вариантов использования (use case) и диаграмму компонентов. ГОСТ 34 на автоматизированные системы и ISO/IEC 25010 на качество ПО помогут обосновать архитектуру и нефункциональные требования.
Как считать эффективность модели в дипломе?
Для задачи классификации навыков используйте accuracy, precision, recall, F1-score и ROC-AUC. И обязательно сравните с базовым решением — например, с простым правилом «если слово встречается в вакансии, то навык есть». Это докажет, что ваша ML-модель действительно лучше.
Темы ВКР на основе кейса «Авито Работа» и Alfa Tech
-
Тема 1. Разработка ML-модели для анализа требований к ИТ-вакансиям
Актуальность: компании пересматривают требования — значит, нужен инструмент, который автоматически извлекает востребованные навыки из текста вакансий.
Цель: построить модель, которая по тексту вакансии определяет ключевые навыки (Python, SQL, Kubernetes и т.п.).
Задачи: сбор и разметка данных, предобработка текста, обучение модели, оценка качества.
Структура: Глава 1 – анализ предметной области и существующих HR-систем; Глава 2 – проектирование и реализация модели (Pipeline на Python); Глава 3 – тестирование и сравнение с базовым подходом. -
Тема 2. Система оценки соответствия резюме и вакансии на основе NLP
Актуальность: HR-менеджеры тратят часы на ручное сравнение кандидатов; ИИ может автоматизировать процесс и снизить субъективность.
Цель: разработать веб-сервис, который по паре «резюме + вакансия» выдаёт score соответствия с указанием недостающих навыков.
Задачи: парсинг резюме и вакансий, выделение навыков (NER или словарный подход), обучение модели ранжирования, создание интерфейса на Flask/FastAPI, тестирование на реальных данных.
Структура: Глава 1 – обзор подходов к автоматизации подбора персонала; Глава 2 – архитектура системы и реализация ML-модуля; Глава 3 – функциональное тестирование и оценка точности. -
Тема 3. Прогнозирование востребованности ИТ-компетенций с помощью временных рядов
Актуальность: статья показывает, что требования быстро меняются. Задача — предсказать, какие навыки будут востребованы через год, чтобы соискатели успевали переобучиться.
Цель: построить модель прогноза динамики упоминаний навыков в вакансиях на основе исторических данных.
Задачи: собрать данные за 2–3 года, выгрузить временные ряды по навыкам, применить ARIMA или Prophet, оценить ошибку, визуализировать тренды.
Структура: Глава 1 – анализ рынка труда и факторов, влияющих на спрос; Глава 2 – построение модели прогнозирования; Глава 3 – интерпретация результатов и рекомендации для HR.
Основная часть: как встроить статью в главы диплома
Глава 1 — Анализ предметной области
Отталкивайтесь от факта из статьи: «Авито Работа» и Alfa Tech внедряют ИИ для оценки сотрудников. Опишите, какие задачи уже автоматизированы, а какие — нет. Составьте обзор инструментов: NLP-библиотеки (spaCy, Natasha), классические ML-алгоритмы, трансформеры (BERT). Здесь же уместно сослаться на ГОСТ 34.601-90 (стадии создания автоматизированных систем) и ISO/IEC 25010 (модель качества ПО), чтобы обосновать требования к разрабатываемой системе. Нарисуйте UML-диаграмму вариантов использования: например, «Анализ вакансии», «Сравнение резюме с вакансией», «Просмотр отчёта». Это станет основой для постановки задачи.
Глава 2 — Проектирование и реализация
Опишите архитектуру решения. Для темы «анализа требований» это может быть конвейер: предобработка текста → векторизация → классификатор. В качестве базовой модели возьмите TF-IDF + логистическую регрессию. Пример кода для вставки в пояснительную записку:
from sklearn.feature_extraction.text import TfidfVectorizer
from sklearn.linear_model import LogisticRegression
from sklearn.pipeline import make_pipeline
from sklearn.metrics import f1_score
# X_train — тексты вакансий, y_train — бинарные метки навыков
model = make_pipeline(
TfidfVectorizer(max_features=5000, stop_words='russian'),
LogisticRegression(max_iter=1000)
)
model.fit(X_train, y_train)
y_pred = model.predict(X_test)
print(f'Weighted F1: {f1_score(y_test, y_pred, average="weighted"):.3f}')
Для лучшего результата можно использовать предобученную модель BERT (например, DualEncoder для поиска навыков), но это усложнит ВКР. Описание архитектуры дополните диаграммой C4 (контейнеры: Web-клиент, API-сервис, ML-модуль, база данных вакансий). В разделе требований к ПО используйте стандарт ISO/IEC 25010, в частности характеристики «Функциональная пригодность» и «Производительность».
Глава 3 — Тестирование и оценка эффективности
Для оценки эффективности ML-модели рассчитайте метрики: accuracy, precision, recall, F1-score. Сравните с базовым решением (например, со словарным методом). Также посчитайте TCO (совокупную стоимость владения) — если проект включает серверную часть, оцените затраты на инфраструктуру. Результаты представьте в виде таблицы сравнения. Оформите тесты в виде сценариев (test cases). Если тема связана с прогнозированием, используйте MAE/RMSE для временных рядов и визуализацию графиков.
Практические выводы: чему вы научитесь в ходе ВКР
- Проектировать ML-пайплайны и обрабатывать текстовые данные с помощью Python.
- Применять стандарты ГОСТ и ISO для описания архитектуры и качества ПО.
- Считать метрики классификации и интерпретировать их для решения HR-задач.
- Строить UML и C4-диаграммы, необходимые для защиты.
- Собирать данные из открытых источников и подготавливать их для обучения моделей.
Типичные ошибки студентов
Ошибка 1. Плохой датасет. Использовать 20 вакансий для обучения — значит, получить случайные результаты. Решение: разметьте минимум 500 примеров (или используйте готовые датасеты). Укажите в работе объём данных и способ их получения.
Ошибка 2. Переобучение без контроля. Если модель показала 99% accuracy на обучающей выборке, но на тестовой — 70%, это катастрофа. Избежите этого: разделите выборку на train/test/validation и используйте кросс-валидацию. В главе 3 обязательно приведите таблицу метрик на тестовой выборке.
Ошибка 3. Отсутствие сравнения с базовым решением. Комиссия всегда спрашивает: «Почему ваша модель лучше простого фильтра по ключевым словам?» Если вы не сравнили, работа кажется неполной. Сделайте простое правило как baseline и покажите прирост метрики.
Чек-лист: что проверить перед сдачей
- Все ли задачи из введения соответствуют выводам в заключении?
- Оформлены ли диаграммы в соответствии с требованиями ГОСТ (ГОСТ 19.701, ГОСТ 2.105)?
- Есть ли в тексте ссылки на источник (статью) и дополнительные материалы?
- Указаны ли метрики эффективности и сравнение с базовой моделью?
- Проверена ли уникальность текста (отчёт о заимствованиях)?
- Приложен ли код с комментариями и понятной структурой файлов?
- Соответствует ли структура работы методичке кафедры (главы и параграфы)?
Помощь эксперта: Если вы поняли, что глубоко копать самостоятельно нет времени — это нормально. Мы помогаем студентам уже более 10 лет: консультируем по выбору темы, разбираем сложные места, рассчитываем метрики и оформляем графики. Бесплатная консультация по вашей ВКР занимает 30 минут — за это время вы получите план действий и поймёте, какие главы требуют серьёзной работы. Возможна разработка отдельных разделов или полное сопровождение работы.
Источник: «Авито Работа» и Alfa tech: как ИИ меняет требования к сотрудникам (опубликовано 2026-03-18)