Голосовой переводчик для Китая
Голосовой переводчик для Китая — мобильный web-прототип для живого устного общения в поездках. Продукт рассчитан на бытовые ситуации, где нужно поговорить с китайским собеседником без общего языка и без постоянных нажатий перед каждой фразой: ресторан, магазин, гостиница, такси, выставка, рынок или короткий разговор на улице.
Продуктовый контур
MVP поддерживает русский, английский и упрощенный китайский. В автоматическом режиме русская и английская речь переводятся на китайский, а китайская речь по умолчанию переводится обратно на русский. В ручном режиме можно зафиксировать конкретное направление: русский → китайский, китайский → русский, английский → китайский или китайский → английский.
UX разговора
Интерфейс построен вокруг одной непрерывной hands-free сессии. Пользователь один раз нажимает «Слушать», дает доступ к микрофону, а приложение дальше само определяет начало и конец реплик, показывает исходную расшифровку, потоковый перевод, финализирует фразу и при необходимости озвучивает результат. Новая речь может перебить воспроизведение перевода, поэтому диалог не превращается в очередь из отдельных записей.
Качество перевода
Модель получает строгую роль переводчика: переводить текущую реплику и не отвечать на вопрос от своего имени. Важные требования — сохранять намерение, отрицания, числа, цены, имена, даты и степень вежливости. Китайский вывод должен быть на упрощенных иероглифах и озвучиваться на путунхуа. В продуктовый план входят пиньинь, обратный перевод для проверки смысла, предупреждения о неуверенности и текстовые альтернативы при нестабильном распознавании.
Realtime-архитектура
Пилот использует легкое мобильное PWA и Gemini Live через Vercel AI Gateway. Сервер хранит постоянный gateway key, выдает короткоживущие realtime-токены клиенту, нормализует языковые настройки, ограничивает частоту запуска сессий и пишет события. Браузер захватывает микрофон с echo cancellation, noise suppression и automatic gain control, отправляет PCM-фреймы, получает input/output transcripts и воспроизводит переведенное аудио.
Данные и наблюдаемость
Прототип сохраняет нормализованные события сессии, финальные реплики, исходные и переведенные аудиофрагменты, определенные языки, provider/model metadata и задержки, включая time to preliminary translation. Это превращает полевые проверки в измеримый dataset: можно разбирать ошибки языка, сравнивать partial и final перевод, собирать регрессионные кейсы и постепенно улучшать качество.
Инженерный фокус
Сложность проекта не в одном вызове модели, а в мобильной задержке, сетевых условиях Китая, barge-in, шумном аудио, автоопределении языка и запрете модели «помогать» вместо перевода. Технический дизайн прячет provider-specific детали за адаптером, предусматривает Hong Kong relay fallback при нестабильном прямом WebSocket из материкового Китая и оставляет Alibaba/Qwen как резервный realtime-контур.
Ценность
Проект превращает телефон в практичного дорожного переводчика для Китая. Он снижает зависимость от посредников, ускоряет обычные бытовые разговоры и дает команде реальные данные качества вместо разрозненных полевых впечатлений.
Галерея
