시각장애인을 위한 손가락에 장착된 판독기기
MIT 미디어연구소의 연구원들은 손가락에 장착된 기기의 프로토타입을 개발하고 있다. 이것에는 내장된 카메라가 부착되어 쓰여져 있는 텍스트를 오디오로 변환시켜 주기 때문에 시각적으로 장애를 가진 사람들이 이용할 수 있게 해줄 것이다.
시각장애인에게 실시간 촉각, 청각으로 피드백
이 기기는 촉각이나 청각으로 피드백을 제공하기 때문에 텍스트 라인을 따라서 사용자들의 손가락을 안내해 주게 된다. 그리고 이 시스템은 실시간으로 이와 관련된 소리를 발생시켜 주게 된다.
MIT 미디어 예술 및 과학과의 대학원생인 Roy Shilkrot는 “당신은 실제로 사람들이 듣는 것과 손가락 끝이 있는 곳 사이의 밀착된 결합을 가지고 있어야 한다. 시각적인 장애를 가진 사용자들을 위해서 이것은 번역되어야만 한다. 손가락이 무엇을 보는가에 상관없이 소리로 번역해야만 하는 것이다. 실제로 이러한 관계를 유지하기 위해서 빠르며, 실시간의 피드백을 필요로 한다. 만약 이것이 깨지게 되면, 이러한 관계에 의해 발생한 환상이 깨지게 되는 것”이라고 말했다. 그는 이 기기에 대한 연구논문의 주저자인 미디어연구실의 박사 후 과정생인 Jochen Huber와 함께 연구를 진행하였다.
Huber는 4월에 열리는 컴퓨팅 머시너리협회의 컴퓨터-인간 인터페이스 컨퍼런스(Association for Computing Machinery’s Computer-Human Interface conference)에서 이 논문을 발표할 예정이다. 그와 Shilkrot와 함께 논문을 작성한 공동저자는 Pattie Maes, MIT 미디어 예술 및 과학과의 Alexander W. Dreyfoos 교수, 싱가포르기술디자인대학교(Singapore University of Technology and Design)의 엔지니어링제품개발학과의 Suranga Nanayakkara 교수 및 싱가포르 난양기술대학교(Nanyang Technological University)의 Meng Ee Wong이다.
햅틱 모터 진동으로 유용성 연구
또한 이 논문은 시각이 손상된 지원자들이 실행한 유용성에 대한 연구결과도 기록하였다. 이 실험에서 연구원들은 그들이 개발한 기기의 여러 가지 변화에 대하여 테스트하였다. 한 가지는 두 개의 햅틱 모터가 포함되어 있는 것으로서, 하나는 손가락의 위에, 또 다른 하나는 손가락의 아래에 있는 것이었다. 모터의 진동은 실험대상을 올려야 하는지 또는 손가락을 추적하기 위해서 더 내려야 하는지를 알려주게 된다.
오디오 피드백 버전으로 피드백 실험
모터가 없는 또 다른 버전은 그 대신에 오디오 피드백을 사용하였다. 만약 사용자의 손가락이 텍스트 줄 위로 이동하기 시작하면 볼륨이 증가한 음악적 톤을 사용하게 되는 것이다. 또한 연구원들은 모터와 음악적 톤을 함께 테스트하였다. 실험대상들 간에 일치하는 것은 없었지만 이러한 종류의 피드백이 가장 유용한 것이었다. 지속적인 실험을 통해서 연구원들은 오디오 피드백에 집중하고 있다. 왜냐하면 이것이 더 작고, 경량인 센서에 적합하기 때문이다.
실시간 성능 여부 카메라 비디오 영상처리 알고리즘이 핵심
시스템의 실시간 성능에 대하여 주요한 점은 카메라 비디오 영상을 처리하기 위한 알고리즘으로서 이것은 Shilkrot와 그의 동료들이 개발한 것이다. 사용자가 손가락을 새로운 줄의 시작점에 위치시킬 때마다 알고리즘은 문자의 기준점에 관한 다수의 추측을 만들게 된다. 대부분의 텍스트 라인들은 가장 아랫부분이 기준점 아래에 내려가 있는 문자를 포함하고 있기 때문에 그리고 손가락의 왜곡되어진 방향이 시스템에게 인접해 있는 줄을 혼동하도록 만들기 때문에, 이러한 추측들이 달라질 수 있게 될 것이다. 그러나 그것들 대부분은 다같이 모여 있게 되며, 알고리즘은 더 조밀한 클러스터의 중간값을 선택하게 된다.
결국, 이 값은 시스템이 각 새로운 비디오 프레임을 가지고 만들게 되는 추측을 한정시키게 된다. 이때 사용자의 손가락은 오른쪽으로 움직이게 되기 때문에 알고리즘의 계산에 따른 부담이 감소되게 된다.
알고리즘은 손가락이 장착된 기기와 연결된 랩탑에서 실행
텍스트의 기준점을 산정하기 위해서 알고리즘은 카메라가 미끄러지듯이 각각의 개별적인 단어를 추적하게 된다. 이것이 카메라의 시야 중심 가까이에 단어가 위치해 있다는 것을 인식하였을 때, 왜곡을 감소시키기 위해서 영상을 벗어난 단어를 잘라내게 된다. 기준점 평가는 또한 알고리즘이 단어를 재정렬할 수 있도록 하는 것으로서 이상한 카메라 앵글에 의해서 발생한 왜곡을 보상해주는 것이다. 이것은 문자를 인식하는 오픈소스 소프트웨어를 통과하고, 인식된 단어를 합성된 음성으로 번역하기 전이다.
새로운 연구논문으로 작성된 이 연구의 알고리즘은 손가락이 장착된 기기와 연결된 랩탑에서 실행되었다. 그러나 진행되고 있는 실험에서 컴퓨터과학 및 공학과 대학원생 Marcel Polanco와 컴퓨터과학전공의 학부생인 Michael Chang은 시스템이 휴대가능하도록 만들어주는 안드로이드폰 구동을 위한 소프트웨어 버전을 개발하고 있다.
손가락 사용으로 빠르게 사물 스캔
연구원들은 또한 그들의 기기가 실험 초기에 알고 있던 것보다 더 광범위한 애플리케이션을 가질 수 있다는 것을 발견하였다. “우리가 이 실험을 시작한 이후로, 이것을 통해서 읽는데 도움을 필요로 하는 사람들에게 혜택을 줄 수 있다는 점이 정말로 확실해지고 있다. 우리는 기관들로부터 많은 이메일과 요청을 받고 있으며, 또한 난독증을 가진 아이들의 부모들로부터의 요청도 많이 받고 있다”고 Shilkrot가 말했다.
“눈의 움직임을 대신하여 손가락을 사용하는 것을 좋은 아이디어이다. 왜냐하면 눈처럼 손가락이 x와 y축을 통해서 재빠르게 움직일 수 있으며, 빠르게 사물을 스캔할 수 있기 때문이다. 나는 그들이 연구한 것에 매우 좋은 인상을 받았다”고 George Stetten이 말했다. 그는 물리학자이며 엔지니어로서 카네기멜런대학교 로봇연구소와 피츠버그대학교 바디오엔지니어링학과에서 공동 연구를 통해서 손가락에 장착된 기기를 개발하고 있는 중이다. 이것은 시각적인 장애를 가진 사용자들에게 원거리에 있는 물체에 대한 정보를 제공해주는 것이다.
자료출처 | KISTI 미리안 『글로벌동향브리핑』
스마트폰에 탑재되기 시작하는 안면인식 기술
반도체 제조사인 퀄컴사는 지난달 모바일 디바이스를 위한 차세대 반도체에 인지기능이 탑재된 소프트웨어를 번들 형태로 제공할 계획이라고 발표하였다. Zeroth라는 명칭으로 명명된 본 칩은 모바일 디바이스 기반의 고도화된 머신 러닝이 가능하도록 지원하게 되는데, 이미지를 처리하는 부분들과 더하여, Zeroth 소프트웨어는 스마트폰으로 하여금 음성인식이나 기타 형태의 사운드까지 인식하여 디바이스상의 센서로부터의 다양한 활동 패턴들을 기록할 수 있도록 지원하게 된다.
이 기술은 언어 인식과 사물 인식에 있어서 최근 발전을 이루고 있는 딥 러닝과 같은 기계학습 방법을 사용하여, 해당 소프트웨어로 하여금 슈퍼급의 성능을 가진 일련의 Atari 게임을 수행할 수 있도록 만들게 된다. 딥 러닝 소프트웨어는 두뇌의 다양한 부분들을 모델링하여 구성되는데, 계층적인 구조로 레이어화된 인공적인 뉴런에 대한 네트워크를 통하여 다양한 사례 사진들을 처리함으로써 이미지상의 특정 오브젝트에 대한 인지작업이 가능하도록 트레이닝 될 수 있을 것으로 기대되고 있다.
정상적인 범주에서, 본 앱은 다양한 트릭을 수행할 수 있기 위하여 고성능 서버 상에서 인터넷 기반으로 여러 가지 데이터를 전송하여야 한다. 스마트폰 자체만으로 이와 같은 계산 작업을 수행하기 위해서, 본 소프트웨어는 스마트폰 디바이스 상에서 로케이션 센서나 모션 센서로부터 산출되는 데이터에 대한 보다 능동적인 차원의 해석 작업이 가능하여야 된다고 관계자들은 말한다. 관련 전문가들은 Zeroth를 응용한 최초의 애플리케이션들이 사용자들이 스마트폰을 사용하는 방법을 조절하여 배터리 수명을 늘리고, 사용자 경험에 영향을 주지 않는 가운데, 에너지를 절전할 수 있도록 스위치까지 자동으로 차단할 수 있을 것으로 기대되고 있다.
자료출처 | KISTI 미리안 『글로벌동향브리핑』




