
Есть исследовательские работы, которые остаются достоянием узкого круга специалистов, а есть те, что фактически меняют инструментарий целой индустрии. Опубликованная в 2013 году статья о модели word2vec относится ко второй категории: она предложила способ превращать слова в числовые векторы так, что математические отношения между этими векторами отражали смысловые связи между словами — подход, который на годы вперёд определил направление развития обработки естественного языка. Автором этой работы был чешский специалист по компьютерным наукам Томаш Миколов.
Профессиональный путь Миколова начался в Университете технологий в Брно, где он проходил докторантуру. Уже в этот период проявилась характерная черта его научной карьеры — стремление учиться у ведущих специалистов мира вне зависимости от географии. В рамках докторских исследований Миколов провёл время в Университете Джонса Хопкинса — визит, организованный при поддержке Санджива Худанпура и Фредерика Елинека, одного из пионеров статистической обработки речи. Кроме того, он провёл несколько месяцев в лаборатории машинного обучения Йошуа Бенджио в Университете Монреаля — сотрудничество с одним из будущих лауреатов премии Тьюринга в области глубокого обучения, состоявшееся ещё до того, как область достигла своего нынешнего признания.
Докторская диссертация Миколова 2012 года, озаглавленная Statistical Language Models Based on Neural Networks, была посвящена применению рекуррентных нейронных сетей к задаче языкового моделирования — направлению, находившемуся тогда на периферии интересов мейнстримной компьютерной лингвистики, но впоследствии ставшему одним из центральных для всей области искусственного интеллекта.
После защиты докторской степени в 2012 году Миколов присоединился к Google Brain — исследовательскому подразделению компании, занимавшемуся передовыми разработками в области глубокого обучения. Именно здесь он возглавил работу, приведшую к созданию word2vec — метода обучения векторных представлений слов на основе больших текстовых массивов. Идея заключалась в том, чтобы представить каждое слово в виде числового вектора таким образом, чтобы семантически близкие слова оказывались близки друг к другу и в векторном пространстве, — подход, позволивший компьютерным системам оперировать смысловыми отношениями между словами гораздо эффективнее, чем прежние методы.
Последующая статья, Distributed Representations of Words and Phrases and their Compositionality, ввела ряд усовершенствованных техник, включая метод негативного сэмплирования, значительно повысивший эффективность обучения. Спустя десять лет эта работа была удостоена премии NeurIPS Test of Time Award 2023 года — награды, присуждаемой исследованиям, доказавшим свою значимость и влияние на протяжении длительного времени, что можно считать редким и весомым признанием долгосрочной ценности проделанной работы.
В 2014 году Миколов перешёл в Facebook AI Research (FAIR), где продолжил заниматься обработкой естественного языка и более широкими исследованиями в области искусственного интеллекта. Именно в этот период он стал соавтором работ, связанных с fastText — библиотекой и набором методов для классификации текста и построения векторных представлений слов на основе подслов, состоящих из отдельных символов. Такой подход, в отличие от word2vec, позволял эффективнее работать с редкими словами и морфологически богатыми языками, поскольку опирался не только на целые слова, но и на составляющие их буквенные фрагменты.
Помимо этого, в FAIR Миколов занимался задачей отображения словарных представлений между разными языками — исследования, находившие практическое применение в построении двуязычных словарей и системах статистического машинного перевода, областях, напрямую связанных с практическими нуждами многоязычных пользователей интернет-платформ.
В 2020 году Миколов вернулся на родину, присоединившись к Чешскому институту информатики, робототехники и кибернетики при Чешском техническом университете в Праге. Там он возглавил новую исследовательскую группу, сосредоточенную на математических моделях, способных увеличивать собственную сложность, — направление, отражающее его давний интерес к фундаментальным вопросам того, как обучающиеся системы могут развиваться и усложняться со временем, выходя за рамки узкоприкладных задач обработки текста.
В 2025 году Миколов стал соучредителем компании BottleCap AI, базирующейся в Праге и занимающейся разработкой эффективных базовых моделей — направление, находящееся сегодня в центре внимания всей индустрии искусственного интеллекта. Основание собственной компании стало для Миколова логичным продолжением его пути — от фундаментальных академических исследований через работу в крупнейших технологических корпорациях мира к созданию собственного предприятия, ориентированного на практическую реализацию накопленной экспертизы.
Карьера Томаша Миколова показательна как пример учёного, чья фундаментальная работа — казалось бы, узкоспециализированная задача представления слов в виде числовых векторов — оказала влияние далеко за пределами исходной области, заложив основу для последующего развития методов обработки естественного языка, использующихся сегодня в бесчисленном множестве практических приложений по всему миру.
Томаш Миколов ученый, компьютерщик. Фото с сайта aroundprague.cz
| Родился: | 08.10.1982 (43) |
| Место: | Шумперк (CZ) |