
200 языков. Не пять, не двадцать — двести. Именно столько языков охватила система машинного перевода NLLB (No Language Left Behind), созданная командой Meta AI Research (признана в РФ экстремистской организацией) при ведущем участии Анджелы Фан.
Ведущий исследователь за моделью M2M-100 компании *Facebook, охватывающей 100 языков, и один из главных участников проекта No Language Left Behind.
Большинство систем машинного перевода работают на 20–30 языках — тех, для которых есть большие объёмы оцифрованных текстов. Остальные тысячи языков — особенно языки коренных народов Африки, Азии и Южной Америки — де-факто исключены из цифровой коммуникации. Это не технологическая проблема, это проблема выбора: кто считается достаточно важным, чтобы его язык перевели.
Анджела Фан сделала этот выбор явным — и попыталась его изменить.
Анджела Фан получила степень бакалавра в области статистики в Гарварде, затем работала инженером-исследователем перед тем, как поступить в докторантуру.
Статистика в Гарварде — это особый способ думать о языке: не как о гуманитарной дисциплине, а как о потоке данных, паттернах вероятностей, распределениях. Этот математический фундамент впоследствии проявится в её подходе к машинному переводу — как к задаче оптимизации с человекоцентрированными ограничениями.
Анджела сделала PhD в INRIA Нанси и FAIR Париж по теме генерации текста. Её научными руководителями были Хлоэ Бро, Антуан Борде и Клэр Гарден.
INRIA — французский национальный институт исследований в области информатики — в сочетании с FAIR (*Facebook AI Research) обеспечило ей сочетание академической строгости и доступа к вычислительным ресурсам промышленного масштаба. Тема диссертации — генерация текста — в тот момент (конец 2010-х) была на переднем крае NLP, ещё до взрыва популярности GPT-архитектур.
Анджела Фан — научный исследователь в Meta AI Research (признана в РФ экстремистской организацией), специализирующийся на машинном переводе. Ранее занималась исследованиями в области on-device моделей для NLP и компьютерного зрения, а также генерации текста.
Переход от генерации текста к переводу — не случайная смена темы, а углубление одной идеи: как модели обрабатывают и порождают язык. Перевод — частный случай генерации, но с дополнительным ограничением: нужно сохранить смысл, меняя форму.
Последние проекты включают No Language Left Behind и Universal Speech Translation for Unwritten Languages — перевод для языков, у которых нет письменности.
Второй проект особенно примечателен: языки без письменности составляют значительную долю языков мира, но они практически полностью выпадают из любой системы машинного перевода, основанной на текстовых данных. Фан разрабатывала подходы, позволяющие работать напрямую со звуком.
Параллельно с работой над переводом Фан вела ещё один проект — менее заметный технически, но показательный идеологически.
Мир вокруг неё гораздо более разнообразен, чем то, что она видит на Википедии. Только около 20% биографий на английском сайте написаны о женщинах, и эта доля, вероятно, ещё меньше для женщин из пересекающихся групп — из Африки или Азии, занятых в науке. Она разработала систему ИИ, которая может исследовать информацию и писать черновики биографических статей в стиле Википедии о важных публичных фигурах, которые сейчас не представлены на платформе.
Она открывает исходный код сквозной модели ИИ, которая автоматически создаёт высококачественные биографические статьи о реальных публичных фигурах. Модель ищет информацию на сайтах и составляет черновик статьи в стиле Википедии, полный цитат.
Это соединение технического и этического измерения — характерная черта её работы. Перевод для 200 языков и автоматические биографии для недопредставленных людей решают разные задачи, но обе связаны с одной и той же идеей: технологии должны работать для всех, а не только для тех, у кого есть доступ к цифровой инфраструктуре.
По данным Google Scholar, работы Анджелы Фан цитировались более 62 000 раз.
Для исследователя в области NLP — впечатляющий показатель, указывающий на то, что её работы стали базовыми для значительной части последующих исследований в области многоязычного перевода и генерации текста.
Среди ключевых работ: FLORES-101 — бенчмарк для оценки качества перевода на малоресурсных языках, ставший стандартом в области. M2M-100 — первая модель перевода, работающая между любыми из 100 языков напрямую, без промежуточного перевода через английский. NLLB — масштабирование этого подхода до 200 языков.
Каждый из этих проектов сдвигал границу того, что считается возможным в многоязычном ИИ — и каждый был явно направлен на сокращение цифрового неравенства.
Биография Анджелы Фан не строится вокруг драматических разворотов карьеры или неожиданных открытий. Это история последовательности: Гарвард ? французская академия ? FAIR ? проекты, охватывающие сотни языков.
То, что выделяет её среди сопоставимых по уровню исследователей — не только технический масштаб проектов, но и выбор тем. В мире, где большинство ресурсов сосредоточено на нескольких хорошо представленных языках и группах, она систематически работала с тем, что остаётся в слепых зонах.
«No Language Left Behind» — это не просто название проекта. Это формулировка позиции.
*соцсеть заблокирована в РФ
Анджела Фан, исследователь ИИ