Yottis Переводчик
Что здесь настоящее. Определение языка, сегментация, защита разметки и подстановок, глоссарий, память переводов и постобработка работают по-настоящему — это те половины качества, которые в проекте названы «не про нейросети». Сам перевод сегмента делает демо-словарь примерно на 200 статей, а не модель: нейросеть в макет не помещается, а выдавать словарь за модель нечестно. Замеры справа сняты с этого кода, а не написаны руками.
Синергия с поиском. Страница уже в индексе, её текст уже извлечён и очищен от обвязки — конкуренту эту страницу нужно сначала скачать. Перевод идёт через ту же защиту разметки: теги и ссылки заменяются метками и возвращаются на место. Если метка потерялась, сегмент отдаётся без перевода — испорченная вёрстка хуже непереведённого текста.
Сохранение вёрстки — суть функции. Перевод, после которого документ нужно верстать заново, экономит половину времени вместо целого. Текст извлекается фильтрами форматов, переводится посегментно и собирается обратно; русский текст в среднем на 15% длиннее английского, и таблицы это переживают плохо — поэтому длина контролируется.
Распознавание и подстановка. Список распознанных строк почти бесполезен: непонятно, что к чему относится. Перевод встаёт на место оригинала — исходный текст затирается с восстановлением фона, размер шрифта подбирается под область. Нажмите переключатель, чтобы увидеть оба состояния.
Каскад из четырёх технологий, и ошибки в нём складываются: распознавание → перевод с контролем длины → синтез голоса → синхронизация. Контроль длины — то, что отличает дубляж от озвученного перевода: реплика, вдвое длиннее оригинала, либо ускоряется до неразборчивости, либо расходится с видео.