| Dynamic Routing for LLM Distillation |
Исследовательский проект по динамической маршрутизации запросов между teacher-моделью Qwen 32B и компактной student-моделью семейства Qwen. Реализованы uncertainty-, IRT-, feature-based и hybrid routers, gain-aware escalation по ожидаемому выигрышу teacher над student, а также отбор teacher-beneficial hard examples для итеративной дистилляции. |
Python, PyTorch, Hugging Face, Qwen, LoRA, knowledge distillation, DISTILLM-2, IRT, LLM-as-a-Judge, OASST1 |
| UEBA: выявление аномалий в логах |
End-to-end UEBA PoC для обнаружения аномального поведения и инсайдерских угроз в CERT r4.2. Обработаны multi-source логи около 1 000 пользователей за около 500 дней; построены user-day признаки, автоэнкодер нормального поведения, USB/DOC detector, псевдопоточный инференс, объяснения аномалий и HTML-отчёты. |
Python, Pandas, PyTorch, scikit-learn, Parquet, Streamlit, anomaly detection, feature engineering |
| Гибридный поиск статей для RAG |
Retrieval-компонент RAG-системы для русскоязычных статей. Объединены TF-IDF, BM25 и dense retrieval на multilingual E5 с FAISS; финальная конфигурация достигла MAP@10 = 0.4112 и MRR = 0.4780 на калибровочной выборке из 500 запросов. |
Python, scikit-learn, sentence-transformers, FAISS, BM25, TF-IDF, pymorphy3, BeautifulSoup |
| Семантический поиск вакансий в мессенджере |
Система сбора, анализа и поиска вакансий в Telegram-чатах и каналах. Обработано около 1 млн сообщений; в Qdrant загружено 817 тыс. векторных представлений. Реализованы семантический поиск по релевантности и свежести, расширенный payload, кластеризация UMAP + HDBSCAN и сегментация KMeans. |
Python, Qdrant, embeddings, vector search, UMAP, HDBSCAN, KMeans, Pandas |
| Cocrystal formation prediction with Graph Neural Networks |
Бинарный классификатор для прогнозирования возможности образования сокристалла из двух молекул. AUC при валидации: ~0,85-0,90, Взвешенная точность: ~0,80-0,85 |
Python, Pandas, scikit-learn, classification, model evaluation |
| Классификация шахматных дебютов |
Исследование моделей классификации шахматных дебютов с выбором конфигурации по компромиссу между точностью и скоростью. Итоговая модель: accuracy 0.81 при времени выполнения 379 секунд. |
PyTorch, RDKit, PyTorch Геометрический, GNN, pandas, numpy, scikit-learn, matplotlib, tqdm |