목록으로
지역사회 문제해결을 위한 AI 활용
키오스크가 어려운 어르신에게 원하는 음료를 묻고, AI가 화면을 읽어 스스로 편리하게 주문할 수 있는 AI 도움 서비스 실사용 사례
👤 똑똑한독수리587 📅 2026-08-12 👁 조회 86
AI가 화면을 읽어 어르신에게 스스로 키오스크 주문이 가능하도록 돕는 AI 서비스 (음성, text 지원)
[개발 계기]
부모님은 지인 모임으로 카페를 자주 이용하십니다. 매장이 붐비는 시간에는 직원에게 주문하기 어렵거나 키오스크를 이용해야 하는 경우가 많은데, 키오스크 화면과 주문 순서가 매장마다 달라 자주 어려움을 겪으셨습니다.

주문 도중 막힐 때마다 부모님은 저에게 영상통화를 걸어 키오스크 화면을 보여주시며 “여기서 무엇을 눌러야 하니?”, “아이스는 어디에 있니?”라고 물어보셨습니다. 저는 영상통화 화면을 보면서 다음에 눌러야 할 버튼을 하나씩 알려드렸습니다.

이 경험을 통해 부모님에게 필요한 것은 키오스크 사용법 전체를 설명하는 설명서가 아니라, 지금 보고 있는 화면을 이해하고 ‘다음에 무엇을 눌러야 하는지’ 바로 알려주는 안내라는 사실을 알게 되었습니다. 하지만 제가 매번 즉시 영상통화를 받아드릴 수는 없었기 때문에, 제가 영상통화로 화면을 보고 안내하던 방식을 AI가 대신할 수 있지 않을까 생각했습니다.

이렇게 해서 스마트폰으로 키오스크 화면을 비추면 AI가 현재 화면을 해석하고, 사용자가 원하는 음료에 맞춰 다음 한 동작만 큰 글자와 음성으로 알려주는 ‘한칸씩AI’를 개발하게 되었습니다.


① 어떤 상황에서 AI를 활용했나요?
카페 키오스크는 매장마다 화면 구성과 버튼 위치가 다르고, 글자가 작거나 주문 단계가 많습니다. 특히 키오스크 이용이 익숙하지 않거나 청력이 좋지 않은 어르신은 무엇을 눌러야 할지 몰라 주문을 포기하거나 직원과 가족에게 도움을 요청하는 경우가 있습니다.

기존의 키오스크 설명서는 특정 기기의 정해진 화면만 안내하는 경우가 많아, 화면 구성이 바뀌면 활용하기 어렵다는 문제가 있었습니다. 이를 해결하기 위해 사용자가 전체 주문 과정을 외울 필요 없이, 현재 화면에서 해야 할 행동 하나만 안내받는 ‘한칸씩AI’를 제작했습니다.


② 어떤 AI를 어떻게 활용했나요?

한칸씩AI를 개발하고 사용하는 과정에서 OpenAI GPT-4o, ChatGPT, OpenAI Codex를 각각 다음과 같이 활용했습니다.

1. OpenAI GPT-4o – 키오스크 화면 분석과 다음 행동 판단

GPT-4o의 이미지 이해 기능을 한칸씩AI의 핵심 기능으로 활용했습니다. 사용자가 스마트폰 카메라로 키오스크를 비추면 현재 화면에 표시된 글자, 버튼의 위치와 색상, 주문 진행 단계를 분석합니다.

특정 키오스크 화면을 미리 등록하거나 버튼 위치를 고정하는 방식이 아니라, AI가 매 순간 보이는 화면을 직접 해석하도록 했습니다. 이를 통해 화면 구성이 다른 키오스크에서도 사용자가 원하는 음료를 주문하려면 다음에 무엇을 눌러야 하는지 판단합니다.

AI의 분석 결과는 다음 행동 안내, 추가 선택 질문, 화면 인식 불확실, 결제·개인정보 화면, 주문 완료 등의 정해진 형태로 전달받도록 구성했습니다. 예를 들어 사용자가 “아이스 아메리카노를 마시고 싶어요”라고 답하면 현재 화면을 분석해 “화면 왼쪽의 ‘커피’ 버튼을 누르세요”처럼 위치와 실제 버튼 글자를 함께 안내합니다.

메뉴·온도·크기·수량처럼 주문에 필요한 정보가 부족한 경우에는 AI가 임의로 선택하지 않습니다. 현재 키오스크 화면에 표시된 선택지를 확인해 “HOT과 ICE 중 어떤 것을 원하시나요?”라고 다시 질문하고, 사용자의 답변을 주문 목표에 추가한 후 화면을 다시 분석합니다.


2. ChatGPT – 문제 정의와 어르신 사용자 경험 설계

ChatGPT는 부모님이 영상통화로 키오스크 사용 방법을 물어보셨던 경험을 구체적인 문제로 정리하고, 이를 AI 활용 사례로 발전시키는 과정에 활용했습니다.

특히 어르신이 앱을 처음 실행했을 때 무엇을 보고 듣게 되는지, 어떤 표현을 사용해야 이해하기 쉬운지, 답변하지 않거나 음성을 잘못 인식했을 때 어떻게 다시 안내해야 하는지 등을 설계하는 데 활용했습니다.

이를 바탕으로 질문을 음성과 큰 글자로 동시에 제공하고, “답변을 기다리는 중” 상태를 명확하게 표시하며, 인식한 답변을 사용자에게 다시 확인하는 대화 흐름을 구성했습니다.


3. OpenAI Codex – 모바일 웹앱 구현과 오류 상황 점검

OpenAI Codex는 설계한 아이디어를 실제로 작동하는 모바일 웹앱으로 구현하는 과정에 활용했습니다. 스마트폰 카메라 화면 연결, GPT-4o 화면 분석 기능, 한국어 음성 입출력, 큰 글자 중심의 사용자 화면, 단계별 상태 관리 기능을 개발했습니다.

또한 음성 인식 실패, 대답 없음, 마이크 권한 거부, 카메라 오류, 네트워크 오류, 화면이 흐리거나 어두운 경우 등 다양한 사용자 행동과 오류 상황을 점검하고, 사용자가 처음부터 다시 시작하지 않고 현재 단계에서 복구할 수 있도록 기능을 보완했습니다.

서로 다른 색상과 버튼 배치를 가진 가상 키오스크 화면 3종도 제작해, 특정 화면에만 맞춘 안내가 되지 않는지 확인할 수 있도록 했습니다.


4. 브라우저 음성 인식·음성 합성 기능 – 어르신과 AI 사이의 대화 수단

브라우저의 한국어 음성 인식 기능을 이용해 사용자가 원하는 음료와 추가 선택 사항을 말로 답할 수 있도록 했습니다. 음성 합성 기능은 질문과 다음 행동을 소리로 읽어주는 데 사용했습니다.

앱을 실행하면 “안녕하세요. 어떤 음료를 드실 예정이신가요?”라고 큰 글자와 음성으로 질문합니다. 음성을 듣는 동안에는 “답변을 기다리는 중”이라고 표시하고, 인식한 답변은 “아이스 아메리카노라고 말씀하셨습니다”와 같이 다시 확인합니다.

음성 인식을 사용할 수 없거나 말을 제대로 알아듣지 못한 경우에는 큰 보기 버튼과 글자 입력 기능을 제공해 음성 기능에만 의존하지 않도록 했습니다.


③ 활용 결과 어떤 변화가 있었나요?

• 이전과 다르게 부모님이 키오스크 주문 중 막힐 때마다 저에게 영상통화를 걸어 도움을 요청하던 일이 줄어들었습니다.
• 부모님 지인분들도 큰 글자와 음성 안내를 따라 키오스크 주문을 끝까지 진행할 수 있었습니다.
• 매장마다 키오스크 화면이 달라도 AI가 현재 화면을 분석해 다음에 눌러야 할 버튼을 알려주기 때문에 별도의 사용법을 배울 필요가 줄었습니다.
• 주문 도중 가족이나 직원에게 도움을 요청하는 횟수도 감소했습니다.
• 결과적으로 부모님과 지인분들이 키오스크를 피하지 않고 직접 사용해 볼 수 있다는 자신감을 갖게 되었습니다.

④ 나만의 방식 또는 개선 포인트는 무엇인가요?
첫째, 여러 단계를 한꺼번에 설명하지 않고 ‘다음 한 동작’만 안내합니다.
둘째, 모든 질문과 안내를 음성뿐 아니라 큰 글자로 동시에 표시해 청력이 좋지 않은 사용자도 내용을 확인할 수 있게 했습니다.
셋째, AI가 화면을 확실하게 판단하지 못하면 임의로 추측하지 않고 화면을 더 가까이 비추도록 요청합니다. 같은 안내가 연속으로 확인됐을 때만 사용자에게 전달해 잘못된 안내 가능성도 줄였습니다.
넷째, 답변 없음, 음성 오인식, 마이크 미지원 상황에서 버튼 선택과 글자 입력으로 전환할 수 있게 했습니다.
다섯째, 결제 및 개인정보 입력 화면이 나타나면 카메라 분석을 자동으로 중지하고, 촬영한 키오스크 이미지를 별도로 저장하지 않도록 설계했습니다.


⑤ 다른 사람도 따라 할 수 있나요?

스마트폰과 카메라를 사용할 수 있는 웹브라우저만 있으면 별도의 전용 장비 없이 이용할 수 있도록 모바일 웹 형태로 제작했습니다. AI가 정해진 화면 템플릿이 아니라 현재 보이는 화면을 해석하므로, 버튼 위치와 디자인이 다른 키오스크에도 적용할 수 있도록 구성했습니다.

카페뿐 아니라 패스트푸드점, 병원 무인접수기, 교통 발권기, 관공서 무인민원기 등 단계가 복잡한 무인기기 안내로도 확장할 수 있습니다. 이용자는 앱을 실행해 원하는 일을 말하고 키오스크 화면을 비추는 방식으로 사용할 수 있습니다.

추후 키오스크 제조사 및 운영사와 연동하면 스마트폰 없이도 키오스크 자체에 음성 질문·답변, 큰 글자 안내, 다음 버튼 표시 기능을 탑재할 수 있습니다.

← 목록