Перейти к основному содержимому Главная страница каталога дополнений для NVDA от русскоязычного сообщества NVDA.RU.

Официальный русскоязычный каталог дополнений NVDA

Крупнейший каталог дополнений для программы экранного доступа NVDA, доступный в Интернете

Каталог дополнений от «🇷🇺 Русскоязычного сообщества NVDA.RU.»

VisAware (Визуальное распознавание)

Автор:

Краткое описание

Vis Aware это дополнение для NVDA, предназначенное для оптического распознавания символов, описания изображений с помощью искусственного интеллекта и автоматического управления компьютером.
Большинство облачных движков требуют подключения к интернету и учётных данных.
Ollama используется для локального самостоятельного развёртывания, например с моделью Google Gemma.
Vis Aware предоставляет три основных режима работы.
Режим OCR извлекает текст из изображений.
Режим описания изображений анализирует визуальное содержимое и позволяет задавать уточняющие вопросы.
Режим AI Agent анализирует экран и выполняет компьютерные действия для решения поставленной задачи.
Источниками распознавания могут быть объект навигатора, весь экран, активное окно или изображение в буфере обмена.
Управление осуществляется с помощью удобных сочетаний клавиш.
Настройки дополнения доступны через меню NVDA.
Дополнение поддерживает множество движков, включая Google Gemini, Google Gemma, PaddleOCR, Ollama и сервисы сообщества NVDACN.
Результаты распознавания отображаются в удобном для чтения виде и могут копироваться в буфер обмена.
Доступна функция автоматического распознавания графических элементов управления при перемещении фокуса.
Дополнение требует отключения затемнения экрана для ручного распознавания.
Особенности дополнения подробно описаны в справочном руководстве.

⬇ Перейти к подробной справке 🔝 Назад к оглавлению

Основная информация

Название Версия Совместимость с API NVDA Последняя протестированная версия NVDA Минимальная версия NVDA Дата загрузки в каталог Размер Лицензия
visAware 0.7.0 2026.1 2026.1.0 2026.1.0 01-08-2026 18:16:25 281 Кб. GPL v2
🔝 Назад к оглавлению

Журнал изменений

Подробнее

0.7.0


🔝 Назад к оглавлению

Скачать

VisAware-V.0.7.0.nvda-addon

⬇ Перейти к истории версий 🔝 Назад к оглавлению

Информация о локализации на русский язык

🔝 Назад к оглавлению

Разделы

🔝 Назад к оглавлению

Справка

Подробнее

VisAware (Визуальное распознавание)

Vis Aware — это дополнение для NVDA, предназначенное для оптического распознавания символов (OCR), описания изображений с помощью искусственного интеллекта, автоматического распознавания и управления компьютером с помощью ИИ.

Vis Aware требует NVDA версии 2026.1 или новее. Большинство облачных движков требуют подключения к интернету и учётных данных сервиса. Для локального развёртывания используется Ollama (например, с моделью Google Gemma).

Быстрый старт

  1. Откройте Меню NVDA > Параметры > Настройки Vis Aware.... На вкладке Основные вы можете войти в свою учётную запись NVDA Chinese Community (www.nvdacn.com), чтобы использовать связанные бесплатные сервисы сообщества. Затем выберите и настройте другие движки по мере необходимости на соответствующих панелях OCR, Описание изображений или AI Агент.

  2. Нажмите NVDA+alt+1, чтобы выбрать режим (тип возможности): OCR, Описание изображений или AI Агент.

  3. Нажмите NVDA+alt+2, чтобы выбрать движок, поддерживаемый в этом режиме. Выберите движок, который вы настроили на шаге 1.

  4. Переместите объект навигатора на содержимое, которое хотите распознать, или нажмите NVDA+alt+3, чтобы выбрать другой источник распознавания (например, изображение или файл изображения в буфере обмена).

  5. Нажмите NVDA+alt+space один раз, чтобы выполнить распознавание с использованием выбранной возможности, или запустить или остановить Агента. Для обычного распознавания:

    • Нажмите один раз, чтобы отобразить результат в документе результатов распознавания NVDA. Для результатов OCR вы можете использовать Enter или Space, чтобы щёлкнуть по координатам, соответствующим тексту; это полезно при распознавании окна.
    • Поведение при двойном нажатии зависит от того, выбран ли параметр Показывать текстовые результаты в просматриваемом сообщении в настройках Основные. Если выбран, результат отображается в диалоге режима обзора NVDA, который подходит для математических формул, таблиц или структурированного содержимого, требующего рендеринга Markdown. Если не выбран, NVDA только озвучивает результат распознавания и не отображает диалог.

Режимы и источники распознавания

Vis Aware предоставляет три режима:

OCR и описание изображений могут использовать следующие источники распознавания:

Режим AI Агента захватывает весь экран напрямую и не использует выбранный источник распознавания.

Команды

Следующие команды имеют назначенные жесты по умолчанию:

Команда Жест по умолчанию
Выполнить распознавание с текущими настройками NVDA+alt+space
Задать дополнительный вопрос о предыдущем описании изображения NVDA+alt+q
Переключение режимов распознавания NVDA+alt+1
Переключение движков для текущего режима NVDA+alt+2
Переключение источников распознавания NVDA+alt+3

Следующие команды не имеют жестов по умолчанию:

После назначения жеста для команды Описывает изображения в буфере обмена нажмите его один раз, чтобы отобразить результат в документе результатов распознавания NVDA. Нажмите дважды подряд, чтобы показать результат в просматриваемом сообщении или озвучить его через NVDA, в зависимости от настройки Показывать текстовые результаты в просматриваемом сообщении.

Результаты распознавания

Когда результаты OCR включают координаты, нажатие enter или space на тексте в документе результатов распознавания щёлкает по соответствующему месту в распознанной области экрана.

Результаты распознавания могут отображаться в виртуальном документе NVDA или, в зависимости от настройки, в диалоге режима обзора. Режим обзора отображает поддерживаемый Markdown и математические формулы. Результаты также можно скопировать в буфер обмена.

Сохраняется только предыдущий результат распознавания из текущей сессии NVDA. Для движков описания изображений, поддерживающих дополнительные вопросы, команда дополнительного вопроса открывает многошаговый диалог и транслирует голосовые ответы, если поддерживается. В этом диалоге control+enter отправляет вопрос, а escape отменяет запрос или закрывает диалог. Используйте Просмотреть форматированное содержимое, чтобы просмотреть начальное описание или последний ответ в режиме обзора.

Дополнительные вопросы поддерживаются Google Gemini, Google Gemma, VIVO BlueLLM Vision и Ollama Vision. Вне диалога беседы потоковый вывод доступен только когда режим обзора не используется.

Автоматическое распознавание

Автоматическое распознавание по умолчанию отключено. На панели Автоматическое распознавание выберите OCR или описание изображений, затем выберите текущий движок или конкретный включённый движок. Поля запроса и модели переопределяют этот движок только для автоматического распознавания. Оставьте запрос пустым, чтобы использовать обычный запрос движка, и выберите Использовать модель, выбранную в настройках движка, чтобы использовать его обычную модель. Если поддерживается, используйте Получить модели, чтобы загрузить доступные имена моделей.

Автоматическое распознавание работает в фоновом режиме, когда системный фокус, курсор режима обзора или объект навигатора перемещаются на поддерживаемый графический элемент управления. Результат автоматически озвучивается и сохраняется как предыдущий результат; дополнительные вопросы доступны, если поддерживаются движком.

Для веб-графики Vis Aware обычно использует URL-адрес изображения и использует снимок экрана объекта, если URL-адрес недоступен. Предпочитать снимки экрана для веб-изображений сначала распознаёт содержимое, отображаемое на экране, и использует URL-адрес, если снимок экрана не может быть получен.

Режим AI Агента

AI Агент запрашивает задачу, начинает работу с активного окна и может работать в разных окнах. Он может щёлкать, вводить текст, нажимать клавиши, прокручивать, перетаскивать, перемещаться, ожидать и запрашивать у вас информацию при необходимости. Действия не подтверждаются по одному, поэтому следите за сессией и при необходимости останавливайте её.

Каждый шаг AI Агента отправляет выбранному сервису полноэкранный снимок экрана, который может включать содержимое других окон. Избегайте запуска AI Агента, когда на экране видна конфиденциальная информация.

AI Агент не может запуститься, пока включена «Штора экрана».

Настройки

Откройте Меню NVDA > Параметры > Настройки Vis Aware....

Диалог настроек содержит следующие панели:

Отключённые движки пропускаются при обычном использовании и переключении движков. По крайней мере один движок должен оставаться включённым в каждом режиме.

Для PaddleOCR / PaddleOCR-VL настройки OCR поддерживают API задачи, размещённой в AI Studio, развёрнутый сервис AI Studio или самостоятельно размещённый сервис PaddleOCR.

Для движков Ollama введите полный URL-адрес API или хост и порт, например localhost:11434. Корневой URL-адрес API по умолчанию — http://localhost:11434/api. Используйте Получить модели, чтобы загрузить имена моделей, затем выберите модель. Если модель не выбрана, используется первая модель, возвращённая Ollama. Необязательный ключ API отправляется как токен Authorization: Bearer. Движки Ollama требуют модель с поддержкой зрения, например Gemma 4; Ollama OCR предоставляет координаты экрана только когда модель возвращает корректные структурированные данные OCR.

Включённые движки

Движки OCR:

Движки описания изображений:

Движки AI Агента:

Доступность движков зависит от их сервиса и конфигурации.

Apple Vision (OCR Server)

Apple Vision (OCR Server) — это движок OCR для локальной сети. Vis Aware отправляет выбранное изображение в OCR Server — приложение с открытым исходным кодом для iOS, которое распознаёт текст с помощью Apple Vision и возвращает координаты текста. Учётная запись облачного OCR не требуется, но компьютер и iPhone должны иметь доступ друг к другу в одной локальной сети.

Текущее приложение требует iOS 18.4 или новее. Самые старые поддерживаемые модели iPhone — iPhone XS, iPhone XS Max, iPhone XR и iPhone SE (2-го поколения).

Для настройки движка:

  1. Установите OCR Server из App Store на iPhone.
  2. Подключите iPhone и компьютер к одной локальной сети, затем откройте OCR Server. Его сервер запускается автоматически и отображает адрес для использования.
  3. Откройте Меню NVDA > Параметры > Настройки Vis Aware... > OCR, включите и выберите Apple Vision (OCR Server), затем введите отображаемый адрес, например 192.168.1.10:8000.

Подключения OCR Server используют неаутентифицированный, незашифрованный HTTP. Используйте этот движок только в доверенной локальной сети; в общедоступных или ненадёжных сетях передаваемые изображения и возвращаемые результаты OCR могут быть перехвачены или изменены.

Держите OCR Server открытым и экран iPhone включённым при использовании движка. Для непрерывной работы следуйте инструкциям вышестоящего проекта для iOS Guided Access. Вышестоящий проект также содержит документацию по использованию приложения и серверному API.

Рекомендуемая автономная настройка: Gemma 4 через Ollama

Для автономной, самостоятельно размещаемой настройки мы рекомендуем запускать модель Gemma 4 с поддержкой зрения локально с помощью Ollama. После загрузки модели и указания URL-адреса API на локальный сервис Vis Aware отправляет изображения в этот локальный сервис. Если вы используете удалённый адрес Ollama, размещённый кем-то другим, данные отправляются в этот удалённый сервис.

Данные и учётные данные

Распознавание отправляет выбранное изображение и, если применимо, запрос в сервис, настроенный для выбранного движка. Каждый шаг AI Агента отправляет полноэкранный снимок экрана выбранному сервису; снимок экрана может включать другие окна. Ознакомьтесь с политикой обработки данных сервиса и избегайте отправки конфиденциального содержимого.

Ручное распознавание из источника, отличного от буфера обмена, требует отключения «Шторы экрана». Пароль NVDACN защищён с помощью Windows DPAPI. Другие сохранённые ключи API хранятся в незашифрованном виде в конфигурации NVDA. Помните о безопасности данных перед созданием или передачей портативной копии NVDA.

Лицензия

Этот проект распространяется под лицензией GNU General Public License версии 2. Подробности см. в файле COPYING.txt.

🔝 Назад к оглавлению

История версий

История версий
Версия файлаТестируемая версия NVDAМинимальная версия NVDAРазмер файла (КБ)Ссылка на загрузку
0.7.02026.1.02026.1.0281VisAware-V.0.7.0.nvda-addon
0.6.52026.1.02026.1.0235VisAware-V.0.6.5.nvda-addon
0.6.42026.1.02026.1.0235VisAware-V.0.6.4.nvda-addon
0.6.22026.1.02026.1.0227VisAware-V.0.6.2.nvda-addon
🔝 Назад к оглавлению