목록으로
업무 생산성 개선을 위한 AI 활용
AI 음성 인식 및 화자 분리 기술을 활용한 화면해설 대본 자동 생성 프로그램(GiNuNi) 개발
화면해설 작가를 위한 타임스탬프 기반 대본 자동 생성 및 화자 분리 데스크톱 프로그램(GiNuNi) 개발
🤖 활용 AI 도구
whisper.cpp, OpenAI gpt-4o-transcribe-diarize, Codex, Openai-API, Gemini
① 어떤 상황에서 AI를 활용했나요?
화면해설작가가 영상이나 유튜브 링크를 시청하며 수작업으로 타임코드를 기록하고 대사를 전사해 5열 양식의 대본을 작성하는 과정의 비효율성을 발견했다. 단순 반복적인 전사 및 타임코드 매핑 작업을 자동화하여 작가의 업무 하중을 줄이고 생산성을 높여야 하는 상황이었다.
② 어떤 AI를 어떻게 활용했나요?
음성 인식과 화자 분리를 위해 로컬 환경의 whisper.cpp 모델과 OpenAI API(gpt-4o-transcribe-diarize)를 결합한 Windows 데스크톱 앱을 구축했다. 최대 3시간 분량의 로컬 영상이나 유튜브 링크를 입력하면 AI가 음성 및 화자를 분석하여 초안을 생성한다. 사용자는 앱 내에서 영상과 표를 대조하며 대사, 화자, 타임코드를 검수한 뒤 업계 표준인 한컴오피스 5열 HWPX 문서 또는 SRT 자막으로 추출하는 구조다. 코딩은 codex로 구현하였고, Hermes Agent와 Gemini 등을 개발 조언자로 활용하였다.
③ 활용 결과 어떤 변화가 있었나요?
기존의 처음부터 끝까지 직접 듣고 타이핑하는 수작업 프로세스가 'AI가 생성한 초안의 오류를 검수하고 수정하는 프로세스'로 전환되었다. 타임코드 추출의 자동화로 인해 작업 소요 시간이 대폭 감소하였으며, 작업자는 내용의 품질과 해설의 적절성에 집중할 수 있게 되었다.
④ 나만의 방식 또는 개선 포인트는 무엇인가요?
데이터 보안과 비용 문제를 동시에 해결했다. 인터넷 연결이 불필요한 약 181MB의 로컬 전사 모델을 기본 엔진으로 탑재하여, 음성 데이터의 외부 유출을 원천 차단하고 API 사용료 없이 작동하도록 설계했다. 또한, 분석 결과를 단순 텍스트가 아닌 화면해설 업계에서 실제 사용하는 HWPX 5열 표 양식으로 정확히 렌더링하여 출력함으로써 사용자의 2차 편집 수고를 제거했다.
⑤ 다른 사람도 따라 할 수 있나요?
화면해설 작가나 모든 개인도 개발된 프로그램에 대해 사용 가능하다. Windows 10/11 환경에서 작동하는 설치 파일(약 198MB)을 제공하여 비개발자도 일반 소프트웨어처럼 설치해 즉시 사용할 수 있다. 초기 1회 로컬 모델을 다운로드하는 과정 외에는 별도의 환경 설정이 불필요하며, 화자 분리 기능이 필요할 때만 선택적으로 OpenAI API 키를 입력하도록 구성하여 접근성을 높였다.
이 개발 방법(소위 바이브 코딩)을 따라하는 것도 물론 가능하다.
화면해설작가가 영상이나 유튜브 링크를 시청하며 수작업으로 타임코드를 기록하고 대사를 전사해 5열 양식의 대본을 작성하는 과정의 비효율성을 발견했다. 단순 반복적인 전사 및 타임코드 매핑 작업을 자동화하여 작가의 업무 하중을 줄이고 생산성을 높여야 하는 상황이었다.
② 어떤 AI를 어떻게 활용했나요?
음성 인식과 화자 분리를 위해 로컬 환경의 whisper.cpp 모델과 OpenAI API(gpt-4o-transcribe-diarize)를 결합한 Windows 데스크톱 앱을 구축했다. 최대 3시간 분량의 로컬 영상이나 유튜브 링크를 입력하면 AI가 음성 및 화자를 분석하여 초안을 생성한다. 사용자는 앱 내에서 영상과 표를 대조하며 대사, 화자, 타임코드를 검수한 뒤 업계 표준인 한컴오피스 5열 HWPX 문서 또는 SRT 자막으로 추출하는 구조다. 코딩은 codex로 구현하였고, Hermes Agent와 Gemini 등을 개발 조언자로 활용하였다.
③ 활용 결과 어떤 변화가 있었나요?
기존의 처음부터 끝까지 직접 듣고 타이핑하는 수작업 프로세스가 'AI가 생성한 초안의 오류를 검수하고 수정하는 프로세스'로 전환되었다. 타임코드 추출의 자동화로 인해 작업 소요 시간이 대폭 감소하였으며, 작업자는 내용의 품질과 해설의 적절성에 집중할 수 있게 되었다.
④ 나만의 방식 또는 개선 포인트는 무엇인가요?
데이터 보안과 비용 문제를 동시에 해결했다. 인터넷 연결이 불필요한 약 181MB의 로컬 전사 모델을 기본 엔진으로 탑재하여, 음성 데이터의 외부 유출을 원천 차단하고 API 사용료 없이 작동하도록 설계했다. 또한, 분석 결과를 단순 텍스트가 아닌 화면해설 업계에서 실제 사용하는 HWPX 5열 표 양식으로 정확히 렌더링하여 출력함으로써 사용자의 2차 편집 수고를 제거했다.
⑤ 다른 사람도 따라 할 수 있나요?
화면해설 작가나 모든 개인도 개발된 프로그램에 대해 사용 가능하다. Windows 10/11 환경에서 작동하는 설치 파일(약 198MB)을 제공하여 비개발자도 일반 소프트웨어처럼 설치해 즉시 사용할 수 있다. 초기 1회 로컬 모델을 다운로드하는 과정 외에는 별도의 환경 설정이 불필요하며, 화자 분리 기능이 필요할 때만 선택적으로 OpenAI API 키를 입력하도록 구성하여 접근성을 높였다.
이 개발 방법(소위 바이브 코딩)을 따라하는 것도 물론 가능하다.