Кой избира думите: Екатерина Коева и границата между AI помощта и личния глас

Димитър Беловеждов Последна промяна на 22 септември 2026 в 20:19 58 0

Кой избира думите: Екатерина Коева и границата между AI помощта и личния глас

Снимка Димитър Беловеждов

Кой избира думите: Екатерина Коева и границата между AI помощта и личния глас

Развойна версия на режима Partner-Aware в SilentVoice AI. Системата предлага възможни отговори, а изборът остава на човека. Микрофонът все още не е свързан в тази версия.

Въпросът е обикновен: „Искаш ли да останем още малко?“. Отговорът може да бъде „да“, „не“ или „уморен съм“. В разговор между двама души това отнема секунди. Когато единият не разполага с надеждна гласова реч и не може сигурно да използва ръцете си, между намерението и отговора се появява посредник - интерфейсът. Неговите възможности определят не само колко бързо ще прозвучи репликата, но и кои думи изобщо ще бъдат достъпни.

Именно в това пространство работи софтуерният разработчик Екатерина Коева. Нейният проект SilentVoice AI използва погледа за избор на послания, които софтуерът превръща в текст и реч. Според представянето на разработката в Newspoint платформата има работещ браузърен прототип със стандартна уеб камера. Зад техническото описание обаче стои въпрос, който засяга всяка система, предлагаща думи от името на човек: къде свършва помощта и откъде започва намесата в разговора?

По актуална информация от разработчика вече е проведен кръг на тестване с четирима участници без техническа подготовка, последван от поправка в системата. Проведено е и независимо техническо ревю на кода. Така работата по проекта вече включва обратна връзка от хора извън процеса на разработване и външен технически преглед.

SilentVoice AI: кой контролира избора на думи

За SilentVoice AI този въпрос е свързан и с планираното развитие. Следващият режим трябва да предлага кратки отговори според казаното от събеседника. Така задачата постепенно се измества от разпознаването на погледа към подбора на възможни реплики. Това са две различни отговорности: да отчетеш правилно избора и да осигуриш достатъчно пространство за него.

„AI не трябва да решава какво казва човекът“, казва Коева в публикацията на Newspoint.

Това изречение има съвсем практическо продължение. Ако програмата предложи само съгласие, отказ и благодарност, човекът може да иска да зададе въпрос. Ако предложи учтив отговор, той може да има нужда да изрази недоволство. Езиково подходящата реплика не е непременно желаната. При комуникационен помощник удобството на готовите думи трябва да се преценява заедно с възможността те да бъдат отхвърлени.

В описания от Коева бъдещ Partner Aware Mode думите на събеседника ще бъдат преобразувани в текст, а системата ще предлага две или три реакции. Изговарянето ще следва едва след избор от потребителя. Режимът е представен като предстояща стъпка, а не като завършена функция. Разграничението е съществено: работещият избор между подготвени карти и свободният разговор с контекстуални предложения поставят различни изисквания към софтуера.

Комуникация чрез поглед: кога системата трябва да спре

Дори преди тази стъпка обаче остава основната задача - погледът да бъде отчетен правилно. В настоящия прототип камерата следи ориентири около очите, а индивидуалното калибриране задава как изглеждат отделните посоки за конкретния човек. Това означава, че системата не започва с предположението, че една настройка е достатъчна за всички. Позицията пред екрана и условията на работа участват в самия процес на избор.

Описаната логика предвижда и момент, в който програмата трябва да спре. При липсваща калибрация, несигурен сигнал или съществено преместване спрямо първоначалната позиция картата не се активира. В ежедневен софтуер подобно прекъсване лесно би било възприето като неудобство. Тук то има друга тежест: непоисканото изречение може да бъде разбрано от събеседника като действителната воля на човека.

Същевременно отказът от действие не решава всичко. Ако се налага твърде често, разговорът се забавя. Човекът може да е избрал отговор, но да чака нова настройка, докато темата вече е сменена. Затова въпросът при оценяването не е само колко грешки допуска системата. Важно е и колко усилие изисква правилният избор и дали темпото позволява участие в обикновен разговор.

Какво показват измерванията на Екатерина Коева

В описанието на проекта има показателен епизод от разработката. При измерване през август Коева установява, че затрудненото различаване на страничния поглед е свързано с формулата за обработка на данните от двете очи. Сигналите се измервали в противоположни посоки и при усредняване частично се заличавали. Корекцията подобрила разделянето на посоките в конкретния тест.

Това първоначално измерване е ограничено до един участник, камера и среда и трябва да се разграничава от вече проведения кръг с четирима участници. То описва конкретен технически проблем и неговото отстраняване, а не обща оценка за надеждността на SilentVoice AI.

Епизодът показва защо впечатлението от една демонстрация не е достатъчно. Видимото движение на курсора или успешно изговорената фраза са резултатът на екрана; проверката трябва да установи при какви условия този резултат се повтаря.

Достъпност със стандартна камера и браузър

Изборът на стандартна камера също поставя въпроса за условията. Той е част от намерението на Коева да намали началната бариера пред използването на платформата. Браузърният достъп би позволил да се започне с налично устройство. Това все още не означава доказано по-нисък общ разход: абонаментната цена не е обявена, а потребностите от настройка и поддръжка са част от оценката на реалната употреба.

За човек, който разчита на подобен инструмент, достъпността не приключва с отварянето на страница. Има значение кой ще помогне при първоначалната настройка, какво ще стане при смяна на устройството и как ще бъде възстановена комуникацията след прекъсване. Това са въпроси за организацията около продукта, наред с качеството на неговия код.

Проведени тестове и независимо техническо ревю

Кръгът с четирима участници без техническа подготовка добавя различна перспектива към работата по SilentVoice AI. Разработчикът познава последователността на действията и логиката зад всеки елемент. Човекът, който за първи път използва интерфейса, трябва да се ориентира по онова, което вижда на екрана. Именно разстоянието между тези две гледни точки е съществено при оценяването на използваемостта.

По информация на Коева след този кръг е направена поправка в системата. Проведено е и независимо техническо ревю на кода. Двете проверки разглеждат различни страни на разработката: взаимодействието на хората с интерфейса и техническата му реализация.

Самото наличие на тестове и ревю не бива да се превръща в твърдение за универсална точност или пригодност за всеки потребител. За такава оценка имат значение обхватът на проверките, конкретните задачи, условията и измерените резултати. Уточнението, че участниците са без техническа подготовка, описва техния опит с технологиите, но само по себе си не дава информация за комуникационните им потребности.

Има и още един участник, който лесно остава извън техническото описание — събеседникът. Той трябва да изчака избора, да разпознае паузата и да остави възможност за поправка. При оценяването на такава платформа има смисъл да се наблюдава целият разговор, включително моментите, когато предложените реплики не вършат работа. Именно тогава става видимо колко свобода остава на потребителя.

Към описания етап работният интерфейс на SilentVoice AI е с достъп чрез покана. Сред посочените направления за последваща оценка остават работата със специалист по допълваща и алтернативна комуникация и по-нататъшните изпитвания при информирано съгласие. Точността, времето за избор, неволното активиране и натоварването при използване са показатели, чрез които развитието на системата може да се проследява.

Екатерина Коева планира да посети AIMSA 2026 в София

Екатерина Коева потвърди, че планира да посети международната конференция AIMSA 2026, която ще се проведе на 15 - 16 октомври 2026 г. в хотел „Витоша Парк“ в София. Според официалния сайт двадесетото издание на форума е посветено на методите, системите и приложенията на изкуствения интелект, с акцент върху генеративния и прогнозиращия AI. Конференцията събира изследователи и специалисти от академичните среди и индустрията.

За разработчик на комуникационна платформа като SilentVoice AI тези теми имат конкретно практическо измерение: как предложенията на един модел могат да бъдат полезни, без да изместват намерението на потребителя. Посещението на подобен форум предоставя възможност за разговор с изследователи и инженери, които работят по различни приложения на същите технологии.

След проведения кръг с участници, последвалата поправка и независимото техническо ревю работата по SilentVoice AI продължава с въпроса доколко решенията се запазват надеждни при по-разнообразни условия на употреба. За проекта това е и проверка на обещанието, заложено в самия подход: помощта да съкращава пътя до думите, без да стеснява смисъла им. В крайна сметка успешният разговор не се измерва само с това дали е прозвучало изречение, а дали човекът е успял да каже онова, което е искал.

Източници:

SilentVoice AI, публично хранилище в GitHub. Публичен код и история на проекта.


Google AI Edge, Face landmark detection guide for Web. Техническа документация за MediaPipe Face Landmarker.

SilentVoice AI, static/calibrate.js. Калибриране, отказ при несигурен сигнал и проверки за позиция.

SilentVoice AI, static/gaze_diag.html. Диагностичен тест на формулата и стойностите от измерването.

Cai и съавт., Nature Communications (2024). Изследване за LLM подпомогната комуникация чрез поглед при ALS.

Lingraphica, Leveraging AI in AAC to Improve Conversations. Практика за AI подпомагане в AAC.

    За писането на коментар е необходима регистрация.
    Моля, регистрирайте се от TУК!
    Ако вече имате регистрация, натиснете ТУК!

    Няма коментари към тази новина !