목록으로
업무 생산성 개선을 위한 AI 활용
AI 시대의 자료관리, 늘어나는 자료를 어떻게 다시 찾을지가 중요합니다
AI 시대의 자료관리, 늘어나는 자료를 어떻게 다시 찾을지가 중요합니다.
🤖 활용 AI 도구
ChatGPT, OpenAI Codex, Google Gemini, NotebookLM, and Local AI
📁 SFM · Smart File Manager
어디에 저장했는지를 기억해야 하는 파일관리에서,
무엇을 기억하는지만으로 다시 찾는 파일관리로.
파일이 많아진 시대에는 **잘 저장하는 것만큼 다시 찾는 것이 중요합니다.
컴퓨터를 오래 사용하다 보면 문서, 사진, 메일, 압축파일이 PC·NAS·외장 저장장치·이메일 등 여러 곳에 흩어집니다.
그런데 실제로 가장 많이 겪는 문제는 자료가 없는 것이 아닙니다.
“분명 저장했는데 어디에 있는지 기억나지 않는다.”
사람은 파일의 정확한 이름이나 폴더 위치보다 보통 이런 단서를 기억합니다.
“2024년 10월에 찍은 사진”
“현대자동차 내용이 들어간 문서”
“메일로 받았던 계약서”
“작년 여름에 사용했던 자료”
“○○회사와 관련된 PDF”
“예전에 불량 때문에 업체하고 주고받았던 자료”
SFM은 이런 **사람·시기·장소·내용·파일 종류와 같은 기억의 단서를 검색의 출발점으로 삼습니다.
자료를 새로운 폴더로 옮겨 다시 정리하는 프로그램이 아닙니다.
흩어진 자료는 원래 위치에 그대로 두고, 필요할 때 다시 찾아갈 수 있도록 안내하는 것.
그것이 SFM의 핵심입니다.
① 🔍 어떤 상황에서 AI를 활용했나요?
처음에는 저 역시 폴더를 잘 정리하면 파일관리 문제가 해결될 것이라고 생각했습니다.
하지만 자료가 수만 건, 수십만 건으로 늘어나면서 한계가 분명해졌습니다.
아무리 잘 정리해도 시간이 지나면
* 어떤 폴더에 저장했는지
* 파일명이 무엇이었는지
* 메일로 받은 것인지
* 압축파일 안에 있었는지
* 어느 저장장치에 있었는지
를 모두 기억하기 어렵습니다.
반면 사람은 자료의 내용과 상황은 비교적 잘 기억합니다.
그래서 질문을 바꾸었습니다. “파일을 어디에 저장했는가?”가 아니라 “사용자는 그 파일에 대해 무엇을 기억하고 있는가?”
SFM은 이 질문에서 시작했습니다.
빠른 파일검색, 파일 내부 내용검색, 이메일, 압축자료, 검색 Evidence와 AI의 의미 판단을 연결해 사용자의 불완전한 기억으로부터 필요한 자료까지 다시 도달하는 검색 구조를 만들었습니다.
② 🤖 AI를 어떻게 활용했나요?
저는 전문 개발자가 아닌 비전공자입니다.
ChatGPT, OpenAI Codex, Google Gemini 등을 활용해 SFM을 개발했습니다.
하지만 AI에게 단순히 “이 기능을 만들어줘.” 라고 요청하고 끝내는 방식은 아니었습니다.
SFM을 개발하면서 반복한 과정은 다음과 같습니다.
**아이디어**
↓
**설계**
↓
**구현**
↓
**실제 측정**
↓
**원인 분석**
↓
**최소 수정**
↓
**재검증**
프로그램이 느려졌을 때도 AI가 예상한 원인을 그대로 믿지 않았습니다. 실제 로그와 측정값을 확인해
* 어느 단계에서 시간이 오래 걸리는지
* 어떤 데이터가 메모리를 많이 사용하는지
* 검색 누락이 발생하는지
* 검색순위가 달라지는지
* 새 기능 때문에 기존 기능이 손상되지는 않는지를 다시 확인했습니다.
따라서 저에게 AI는 단순한 코드 생성기가 아니라 개발자 + 분석가 + 테스트 담당자 역할을 함께 수행하는 협업 도구였습니다.
그리고 AI는 개발 과정에만 사용되지 않았습니다. SFM 자체에도 AI를 적용해 상황에 따라
빠른검색 · 내용검색 · Local AI · Cloud AI · Hybrid AI를 선택해 사용할 수 있도록 구성했습니다.
③ 🧠 SFM은 어떻게 자료를 찾나요?
SFM의 가장 중요한 특징은 모든 검색을 AI에게 맡기지 않는 것입니다.
단순한 검색은 빠른 검색기술이 담당하고, 의미 판단이 필요한 부분에만 AI를 사용합니다.
예를 들어
“2024년 10월 PDF”
처럼 조건이 명확한 검색은 굳이 AI가 긴 추론을 할 필요가 없습니다.
반대로
“작년에 업체하고 불량 때문에 주고받았던 자료”
처럼 사람의 기억이 섞인 검색은 AI의 의미 판단이 도움이 됩니다.
SFM은 이런 차이를 구분해 검색합니다.
🔎 기본 검색 흐름
**사용자의 기억**
↓
**검색 의도와 조건 파악**
↓
**PC · NAS · Mail · Archive에서 후보 검색**
↓
**Recall-First 방식으로 관련 가능성이 있는 자료 확보**
↓
**Evidence와 검색 점수로 후보 정리**
↓
**필요한 경우에만 AI 판단**
↓
**가장 가능성 높은 결과 제시**
중요한 것은 AI가 처음부터 수십만 개의 자료를 모두 읽는 방식이 아니라는 점입니다.
검색기술은 넓게 찾고, AI는 필요한 부분을 판단하도록 역할을 나누었습니다.
④ 🔄 SFM은 사용할수록 검색 경험을 활용합니다
사람마다 파일을 찾는 방식이 다릅니다.
같은 “견적”이라는 단어를 사용해도 어떤 사람은 `견적서.xlsx`를 찾고, 다른 사람은 `단가표`, `quotation`, `estimate`라는 표현을 사용한 자료를 찾을 수 있습니다.그래서 SFM은 검색 경험을 다음 검색에 활용하는 구조를 추가했습니다.
👤 Personal Search Memory
사용자가 AI 검색 후 실제로 어떤 자료를 열었는지를 검색의 보조 신호로 활용합니다.
예를 들어 사용자가 반복해서
“베트남 견적”이라고 검색한 뒤 특정 폴더의 견적자료를 선택했다면 다음 검색에서는 그 경험을 참고할 수 있습니다.
다만 한 번의 잘못된 선택이 이후 검색을 망치지 않도록 했습니다.
검색 기억은 정답 후보를 삭제하는 강제 조건이 아니라 검색 우선순위를 돕는 보조 신호로만 사용합니다.
즉,사용자를 기억하지만, 사용자의 과거 행동만 믿지는 않습니다.
🔤 검색어도 실제 자료를 기준으로 보완합니다
업무자료에는 같은 의미가 여러 방식으로 표현됩니다.
예를 들어
솔더라는 단어는 자료에 따라
* solder
* soldering
* 납땜 으로 작성되어 있을 수 있습니다.
처음 `솔더`를 검색했을 때는 기존 검색을 그대로 실행합니다.
검색을 AI 때문에 기다리게 하지 않습니다.
그 뒤 AI가 비슷한 표현을 제안하고, 실제 SFM 자료에 그 표현이 존재하는지, 같은 문맥에서 사용되는지 확인한 뒤 검증된 표현만 검색 Cache에 저장합니다.다음 검색부터는 검증된 표현을 제한적으로 활용할 수 있습니다.
즉,AI가 마음대로 검색어를 늘리는 것이 아니라 실제 사용자의 자료에서 확인된 표현만 검색을 보조합니다.
따라서 SFM은 사용자가 가진 자료의 표현 방식에 조금씩 적응할 수 있습니다.
⑤ 📚 SFM은 파일을 찾는 것에서 끝나지 않습니다 — Selective RAG
SFM을 만들면서 다음 단계의 문제가 생겼습니다.
파일을 찾았다고 해서 항상 문제가 끝나는 것은 아니었습니다.
예를 들어 과거 품질문서가 여러 개 검색됐을 때 사용자가 궁금한 것은 파일명이 아니라
“그때 솔더 불량의 원인이 뭐였지?”일 수 있습니다.
그래서 검색된 자료를 근거로 질문에 답할 수 있도록 **Selective RAG 구조**를 적용했습니다.
예를 들어
사용자 질문:
“당시 솔더 불량의 주요 원인과 조치가 뭐였어?”
SFM은 먼저 관련 자료를 검색합니다.그다음 모든 문서를 그대로 AI에 넘기지 않습니다.
질문이 원인을 묻는지, 조치를 묻는지, 날짜·수치·비교·결과를 묻는지를 판단하고 그 질문과 관련성이 높은 부분을 선별합니다.
흐름은 다음과 같습니다.
**사용자 질문**
↓
**관련 자료 검색**
↓
**관련성이 높은 문서와 문단 선별**
↓
**원인 · 조치 · 날짜 · 수치 등 질문 목적에 맞는 근거 추출**
↓
**필요한 근거만 AI에 제공**
↓
**근거 기반 답변 생성**
↓
**사용자가 원본 자료 확인**
이 방식의 목적은 AI가 일반지식으로 그럴듯한 답을 만드는 것이 아닙니다.
내가 가지고 있는 실제 자료를 근거로 답하도록 하는 것입니다.
⑥ 🔎 AI 답변보다 중요한 것은 ‘근거’라고 생각했습니다
AI는 매우 유용하지만 항상 맞는 것은 아닙니다.그래서 SFM에서는 AI의 답만 보여주는 것보다
“왜 이 자료가 검색됐는가?” 를 확인할 수 있게 하는 것을 중요하게 생각했습니다.
SFM의 Evidence 구조는
* 파일명
* 경로
* 문서 본문
* 날짜
* 파일 종류
* 문서 내부 구조
* 사진의 촬영정보와 위치정보 등 ㅠ검색 가능한 여러 단서를 활용합니다.
그리고 직접적인 근거가 강한 자료는 AI의 확률적인 판단 때문에 쉽게 사라지지 않도록 보호하는 방향으로 설계했습니다.
즉,AI가 검색결과를 결정하는 구조가 아니라 검색 근거 위에서 AI가 판단을 보조하는 구조입니다.
Selective RAG에서도 같은 원칙을 적용했습니다.
근거가 충분하지 않으면 억지로 답을 만드는 것보다 원본 자료를 보여주는 것이 더 중요하다고 생각했습니다.
⑦ 📈 ‘된다’가 아니라 실제 자료에서 반복 검증했습니다
SFM 초기 버전은 기능은 동작했지만 대규모 자료를 처리하면서 문제가 발생했습니다.
* 프로그램 시작 지연
* 검색 준비시간 증가
* 높은 메모리 사용
* 미리보기 지연
* 복잡한 자연어 검색의 응답시간 증가
처음에는 많은 데이터를 모두 준비한 뒤 프로그램을 사용하는 구조에 가까웠습니다.
하지만 처리단계별 시간과 메모리 사용량을 측정하면서“모든 것이 준비될 때까지 기다리는 구조”
에서 “사용자에게 필요한 기능부터 먼저 사용할 수 있는 구조”로 개선했습니다.
단순 파일검색과 파일 내부까지 분석하는 내용검색도 분리했습니다.
📊 실제 검증 환경
📁 약 32만 건 규모의 실제 파일 인덱스
📦 약 1,950건의 압축파일 컨테이너 포함
✉️ 이메일 및 첨부자료 검색 연계
🎯 테스트 조건에 따라 검색 후보 Recall 약 96~100% 수준 확인
🔄 기능 변경 시 검색 누락 · 검색순위 · 속도 · 기존 기능 회귀를 반복 확인
Recall은 쉽게 말하면“찾아야 할 자료를 검색 과정에서 얼마나 놓치지 않았는가”를 의미합니다.
SFM에서는 새로운 기능을 추가해 검색이 빨라졌더라도 필요한 자료가 빠지면 성공으로 보지 않았습니다.
반대로 검색 정확도가 올라가더라도 사용하기 어려울 정도로 느려지면 역시 성공으로 보지 않았습니다.
제가 적용한 기준은 단순했습니다.
> 속도 ↑
> 검색 품질 유지
> 기존 기능 유지**
이 세 가지가 함께 만족해야 실제 개선으로 판단했습니다.
※ 검색속도와 성능은 PC 사양, 저장장치, 파일 수, 검색조건 등에 따라 달라질 수 있습니다.
⑧ ⚡ 수십만 건의 자료를 매번 처음부터 준비하지 않도록 했습니다
수십만 건의 자료가 있는 환경에서는 검색 정확도뿐 아니라 검색 준비시간도 중요했습니다.
그래서 SFM은 이미 확인된 색인과 검색정보를 재활용하고, 변경된 부분만 갱신할 수 있도록 검색 준비 구조를 개선했습니다.
중요한 점은 속도를 위해 기존 검색결과를 바꾸지 않는 것이었습니다.
검색 Cache와 보조 정보는 기존 검색을 대신하는 것이 아니라 **기존 검색을 더 빠르게 사용할 수 있도록 돕는 역할**로 분리했습니다.
Cache가 없거나 문제가 발생하더라도 기본 검색으로 돌아갈 수 있도록 구성해 새로운 기능 때문에 검색 자체가 멈추지 않도록 했습니다. 이러한 개선을 통해 SFM은 단순히 AI 기능을 계속 추가하는 방향보다
> 필요한 곳에만 AI를 사용하고,
> 이미 확인한 정보는 다시 활용하며,
> 기존 검색 품질을 보호하는 방향 으로 발전했습니다.
⑨ 🔐 업무자료를 다루기 때문에 개인정보 보호를 함께 설계했습니다
SFM을 개발하면서 성능만큼 중요하게 생각한 문제가 있습니다.
> “업무자료를 AI가 분석할 때 개인정보와 내부문서를 어떻게 보호할 것인가?”기업이나 업무환경에는
* 계약서
* 고객자료
* 개인정보
* 내부문서
* 이메일
처럼 외부 AI 서버로 그대로 보내기 부담스러운 자료가 많습니다.
그래서 SFM은 하나의 AI 방식만 강제하지 않습니다.
🖥️ Local AI
AI 모델을 사용자의 PC 내부에서 실행합니다.
문서 내용을 외부 AI 서버로 전송하지 않고 PC 안에서 분석할 수 있기 때문에
> “AI 검색은 사용하고 싶지만 회사자료를 외부로 보내고 싶지는 않다.”는 상황을 고려했습니다.
PC 성능에 따라 처리속도가 달라질 수 있지만 자료를 외부로 보내지 않고 AI 기능을 사용할 수 있다는 것이 가장 큰 장점입니다.
☁️ Cloud AI
더 높은 수준의 추론이 필요한 경우 Cloud AI를 선택할 수 있습니다.
그러나 Cloud AI를 사용한다고 해서 문서 전체와 개인정보를 그대로 외부로 전달하는 방식을 지향하지 않습니다.
AI 판단에 반드시 필요하지 않은 개인정보와 민감정보는 가능한 범위에서 마스킹하고, 필요한 정보만 제한적으로 전달하도록 설계했습니다.
🔄 Hybrid AI
Local과 Cloud를 단순히 절반씩 사용하는 방식이 아닙니다. 자료의 민감도와 질문의 성격에 따라
* 민감한 자료는 Local 중심으로 처리하고
* Cloud 사용이 가능한 경우에만 필요한 AI 추론을 활용하며
* 필요할 경우 결과를 서로 보완하도록구성했습니다.
즉 사용자가 속도 · AI 성능 · 개인정보 보호 중 자신의 상황에 맞는 방식을 선택할 수 있도록 했습니다.
⑩ 🌱 다른 사람도 따라 할 수 있나요?
가능하다고 생각합니다.저는 전문 개발자로 시작한 것이 아닙니다.
처음부터 복잡한 AI 기술이나 검색 알고리즘을 알고 있었던 것도 아닙니다.
제가 가장 먼저 한 것은 프로그래밍 공부가 아니라 “내가 실제로 불편한 문제가 무엇인가?”
를 구체적으로 정의하는 것이었습니다.
그리고 AI와 함께
**작은 기능 만들기**
↓
**직접 사용하기**
↓
**문제 발견하기**
↓
**측정하기**
↓
**원인 분석하기**
↓
**다시 개선하기**
를 반복했습니다.
SFM을 통해 보여주고 싶은 것은
> “AI가 개발자를 대신한다.”
는 이야기가 아닙니다.제가 보여주고 싶은 것은
> 전문 개발자가 아니더라도
> 자신이 잘 알고 있는 생활과 업무의 문제를 발견하고,
> AI와 협업하며 실제 결과를 측정하고 검증한다면
> 하나의 아이디어를 실제 사용할 수 있는 프로그램으로 발전시킬 수 있다는 가능성입니다.
🎯 SFM이 말하고 싶은 핵심
SFM은 단순히 AI가 파일을 찾아주는 프로그램을 목표로 하지 않습니다.
사용자가 기억나는 방식으로 질문하면
**기억의 단서**
↓
**사용자의 검색 경험**
↓
**검증된 검색 표현 Cache**
↓
**PC · NAS · Mail · Archive 검색**
↓
**Recall-First 후보 확보**
↓
**Evidence로 검색 이유 확인**
↓
**AI가 필요한 후보만 판단**
↓
**Selective RAG로 관련 내용 선별**
↓
**실제 자료를 근거로 답변**
↓
**원본 파일 확인**
까지 하나의 흐름으로 연결하는 것이 목표입니다.
자료가 많아질수록 모든 파일을 완벽하게 정리하는 것은 점점 어려워집니다.
하지만 사람은 여전히 사람 · 시기 · 장소 · 내용 · 파일 종류 · 당시 상황을 기억합니다.
SFM은 그 기억을 출발점으로 삼습니다.
자료를 새로운 곳으로 옮겨 정리하는 것이 아니라,이미 가지고 있는 자료로 다시 돌아가는 길을 만드는 것.
그것이 SFM입니다.
📁 어디에 저장했는지를 기억해야 하는 파일관리에서,
무엇을 기억하는지만으로 다시 찾는 파일관리로.
AI 시대의 자료관리,늘어나는 자료를 어떻게 저장할 것인가만큼 어떻게 다시 찾을 것인가가 중요합니다.
🤖 AI Tools Used
**ChatGPT · OpenAI Codex · Google Gemini · NotebookLM · Local AI**
어디에 저장했는지를 기억해야 하는 파일관리에서,
무엇을 기억하는지만으로 다시 찾는 파일관리로.
파일이 많아진 시대에는 **잘 저장하는 것만큼 다시 찾는 것이 중요합니다.
컴퓨터를 오래 사용하다 보면 문서, 사진, 메일, 압축파일이 PC·NAS·외장 저장장치·이메일 등 여러 곳에 흩어집니다.
그런데 실제로 가장 많이 겪는 문제는 자료가 없는 것이 아닙니다.
“분명 저장했는데 어디에 있는지 기억나지 않는다.”
사람은 파일의 정확한 이름이나 폴더 위치보다 보통 이런 단서를 기억합니다.
“2024년 10월에 찍은 사진”
“현대자동차 내용이 들어간 문서”
“메일로 받았던 계약서”
“작년 여름에 사용했던 자료”
“○○회사와 관련된 PDF”
“예전에 불량 때문에 업체하고 주고받았던 자료”
SFM은 이런 **사람·시기·장소·내용·파일 종류와 같은 기억의 단서를 검색의 출발점으로 삼습니다.
자료를 새로운 폴더로 옮겨 다시 정리하는 프로그램이 아닙니다.
흩어진 자료는 원래 위치에 그대로 두고, 필요할 때 다시 찾아갈 수 있도록 안내하는 것.
그것이 SFM의 핵심입니다.
① 🔍 어떤 상황에서 AI를 활용했나요?
처음에는 저 역시 폴더를 잘 정리하면 파일관리 문제가 해결될 것이라고 생각했습니다.
하지만 자료가 수만 건, 수십만 건으로 늘어나면서 한계가 분명해졌습니다.
아무리 잘 정리해도 시간이 지나면
* 어떤 폴더에 저장했는지
* 파일명이 무엇이었는지
* 메일로 받은 것인지
* 압축파일 안에 있었는지
* 어느 저장장치에 있었는지
를 모두 기억하기 어렵습니다.
반면 사람은 자료의 내용과 상황은 비교적 잘 기억합니다.
그래서 질문을 바꾸었습니다. “파일을 어디에 저장했는가?”가 아니라 “사용자는 그 파일에 대해 무엇을 기억하고 있는가?”
SFM은 이 질문에서 시작했습니다.
빠른 파일검색, 파일 내부 내용검색, 이메일, 압축자료, 검색 Evidence와 AI의 의미 판단을 연결해 사용자의 불완전한 기억으로부터 필요한 자료까지 다시 도달하는 검색 구조를 만들었습니다.
② 🤖 AI를 어떻게 활용했나요?
저는 전문 개발자가 아닌 비전공자입니다.
ChatGPT, OpenAI Codex, Google Gemini 등을 활용해 SFM을 개발했습니다.
하지만 AI에게 단순히 “이 기능을 만들어줘.” 라고 요청하고 끝내는 방식은 아니었습니다.
SFM을 개발하면서 반복한 과정은 다음과 같습니다.
**아이디어**
↓
**설계**
↓
**구현**
↓
**실제 측정**
↓
**원인 분석**
↓
**최소 수정**
↓
**재검증**
프로그램이 느려졌을 때도 AI가 예상한 원인을 그대로 믿지 않았습니다. 실제 로그와 측정값을 확인해
* 어느 단계에서 시간이 오래 걸리는지
* 어떤 데이터가 메모리를 많이 사용하는지
* 검색 누락이 발생하는지
* 검색순위가 달라지는지
* 새 기능 때문에 기존 기능이 손상되지는 않는지를 다시 확인했습니다.
따라서 저에게 AI는 단순한 코드 생성기가 아니라 개발자 + 분석가 + 테스트 담당자 역할을 함께 수행하는 협업 도구였습니다.
그리고 AI는 개발 과정에만 사용되지 않았습니다. SFM 자체에도 AI를 적용해 상황에 따라
빠른검색 · 내용검색 · Local AI · Cloud AI · Hybrid AI를 선택해 사용할 수 있도록 구성했습니다.
③ 🧠 SFM은 어떻게 자료를 찾나요?
SFM의 가장 중요한 특징은 모든 검색을 AI에게 맡기지 않는 것입니다.
단순한 검색은 빠른 검색기술이 담당하고, 의미 판단이 필요한 부분에만 AI를 사용합니다.
예를 들어
“2024년 10월 PDF”
처럼 조건이 명확한 검색은 굳이 AI가 긴 추론을 할 필요가 없습니다.
반대로
“작년에 업체하고 불량 때문에 주고받았던 자료”
처럼 사람의 기억이 섞인 검색은 AI의 의미 판단이 도움이 됩니다.
SFM은 이런 차이를 구분해 검색합니다.
🔎 기본 검색 흐름
**사용자의 기억**
↓
**검색 의도와 조건 파악**
↓
**PC · NAS · Mail · Archive에서 후보 검색**
↓
**Recall-First 방식으로 관련 가능성이 있는 자료 확보**
↓
**Evidence와 검색 점수로 후보 정리**
↓
**필요한 경우에만 AI 판단**
↓
**가장 가능성 높은 결과 제시**
중요한 것은 AI가 처음부터 수십만 개의 자료를 모두 읽는 방식이 아니라는 점입니다.
검색기술은 넓게 찾고, AI는 필요한 부분을 판단하도록 역할을 나누었습니다.
④ 🔄 SFM은 사용할수록 검색 경험을 활용합니다
사람마다 파일을 찾는 방식이 다릅니다.
같은 “견적”이라는 단어를 사용해도 어떤 사람은 `견적서.xlsx`를 찾고, 다른 사람은 `단가표`, `quotation`, `estimate`라는 표현을 사용한 자료를 찾을 수 있습니다.그래서 SFM은 검색 경험을 다음 검색에 활용하는 구조를 추가했습니다.
👤 Personal Search Memory
사용자가 AI 검색 후 실제로 어떤 자료를 열었는지를 검색의 보조 신호로 활용합니다.
예를 들어 사용자가 반복해서
“베트남 견적”이라고 검색한 뒤 특정 폴더의 견적자료를 선택했다면 다음 검색에서는 그 경험을 참고할 수 있습니다.
다만 한 번의 잘못된 선택이 이후 검색을 망치지 않도록 했습니다.
검색 기억은 정답 후보를 삭제하는 강제 조건이 아니라 검색 우선순위를 돕는 보조 신호로만 사용합니다.
즉,사용자를 기억하지만, 사용자의 과거 행동만 믿지는 않습니다.
🔤 검색어도 실제 자료를 기준으로 보완합니다
업무자료에는 같은 의미가 여러 방식으로 표현됩니다.
예를 들어
솔더라는 단어는 자료에 따라
* solder
* soldering
* 납땜 으로 작성되어 있을 수 있습니다.
처음 `솔더`를 검색했을 때는 기존 검색을 그대로 실행합니다.
검색을 AI 때문에 기다리게 하지 않습니다.
그 뒤 AI가 비슷한 표현을 제안하고, 실제 SFM 자료에 그 표현이 존재하는지, 같은 문맥에서 사용되는지 확인한 뒤 검증된 표현만 검색 Cache에 저장합니다.다음 검색부터는 검증된 표현을 제한적으로 활용할 수 있습니다.
즉,AI가 마음대로 검색어를 늘리는 것이 아니라 실제 사용자의 자료에서 확인된 표현만 검색을 보조합니다.
따라서 SFM은 사용자가 가진 자료의 표현 방식에 조금씩 적응할 수 있습니다.
⑤ 📚 SFM은 파일을 찾는 것에서 끝나지 않습니다 — Selective RAG
SFM을 만들면서 다음 단계의 문제가 생겼습니다.
파일을 찾았다고 해서 항상 문제가 끝나는 것은 아니었습니다.
예를 들어 과거 품질문서가 여러 개 검색됐을 때 사용자가 궁금한 것은 파일명이 아니라
“그때 솔더 불량의 원인이 뭐였지?”일 수 있습니다.
그래서 검색된 자료를 근거로 질문에 답할 수 있도록 **Selective RAG 구조**를 적용했습니다.
예를 들어
사용자 질문:
“당시 솔더 불량의 주요 원인과 조치가 뭐였어?”
SFM은 먼저 관련 자료를 검색합니다.그다음 모든 문서를 그대로 AI에 넘기지 않습니다.
질문이 원인을 묻는지, 조치를 묻는지, 날짜·수치·비교·결과를 묻는지를 판단하고 그 질문과 관련성이 높은 부분을 선별합니다.
흐름은 다음과 같습니다.
**사용자 질문**
↓
**관련 자료 검색**
↓
**관련성이 높은 문서와 문단 선별**
↓
**원인 · 조치 · 날짜 · 수치 등 질문 목적에 맞는 근거 추출**
↓
**필요한 근거만 AI에 제공**
↓
**근거 기반 답변 생성**
↓
**사용자가 원본 자료 확인**
이 방식의 목적은 AI가 일반지식으로 그럴듯한 답을 만드는 것이 아닙니다.
내가 가지고 있는 실제 자료를 근거로 답하도록 하는 것입니다.
⑥ 🔎 AI 답변보다 중요한 것은 ‘근거’라고 생각했습니다
AI는 매우 유용하지만 항상 맞는 것은 아닙니다.그래서 SFM에서는 AI의 답만 보여주는 것보다
“왜 이 자료가 검색됐는가?” 를 확인할 수 있게 하는 것을 중요하게 생각했습니다.
SFM의 Evidence 구조는
* 파일명
* 경로
* 문서 본문
* 날짜
* 파일 종류
* 문서 내부 구조
* 사진의 촬영정보와 위치정보 등 ㅠ검색 가능한 여러 단서를 활용합니다.
그리고 직접적인 근거가 강한 자료는 AI의 확률적인 판단 때문에 쉽게 사라지지 않도록 보호하는 방향으로 설계했습니다.
즉,AI가 검색결과를 결정하는 구조가 아니라 검색 근거 위에서 AI가 판단을 보조하는 구조입니다.
Selective RAG에서도 같은 원칙을 적용했습니다.
근거가 충분하지 않으면 억지로 답을 만드는 것보다 원본 자료를 보여주는 것이 더 중요하다고 생각했습니다.
⑦ 📈 ‘된다’가 아니라 실제 자료에서 반복 검증했습니다
SFM 초기 버전은 기능은 동작했지만 대규모 자료를 처리하면서 문제가 발생했습니다.
* 프로그램 시작 지연
* 검색 준비시간 증가
* 높은 메모리 사용
* 미리보기 지연
* 복잡한 자연어 검색의 응답시간 증가
처음에는 많은 데이터를 모두 준비한 뒤 프로그램을 사용하는 구조에 가까웠습니다.
하지만 처리단계별 시간과 메모리 사용량을 측정하면서“모든 것이 준비될 때까지 기다리는 구조”
에서 “사용자에게 필요한 기능부터 먼저 사용할 수 있는 구조”로 개선했습니다.
단순 파일검색과 파일 내부까지 분석하는 내용검색도 분리했습니다.
📊 실제 검증 환경
📁 약 32만 건 규모의 실제 파일 인덱스
📦 약 1,950건의 압축파일 컨테이너 포함
✉️ 이메일 및 첨부자료 검색 연계
🎯 테스트 조건에 따라 검색 후보 Recall 약 96~100% 수준 확인
🔄 기능 변경 시 검색 누락 · 검색순위 · 속도 · 기존 기능 회귀를 반복 확인
Recall은 쉽게 말하면“찾아야 할 자료를 검색 과정에서 얼마나 놓치지 않았는가”를 의미합니다.
SFM에서는 새로운 기능을 추가해 검색이 빨라졌더라도 필요한 자료가 빠지면 성공으로 보지 않았습니다.
반대로 검색 정확도가 올라가더라도 사용하기 어려울 정도로 느려지면 역시 성공으로 보지 않았습니다.
제가 적용한 기준은 단순했습니다.
> 속도 ↑
> 검색 품질 유지
> 기존 기능 유지**
이 세 가지가 함께 만족해야 실제 개선으로 판단했습니다.
※ 검색속도와 성능은 PC 사양, 저장장치, 파일 수, 검색조건 등에 따라 달라질 수 있습니다.
⑧ ⚡ 수십만 건의 자료를 매번 처음부터 준비하지 않도록 했습니다
수십만 건의 자료가 있는 환경에서는 검색 정확도뿐 아니라 검색 준비시간도 중요했습니다.
그래서 SFM은 이미 확인된 색인과 검색정보를 재활용하고, 변경된 부분만 갱신할 수 있도록 검색 준비 구조를 개선했습니다.
중요한 점은 속도를 위해 기존 검색결과를 바꾸지 않는 것이었습니다.
검색 Cache와 보조 정보는 기존 검색을 대신하는 것이 아니라 **기존 검색을 더 빠르게 사용할 수 있도록 돕는 역할**로 분리했습니다.
Cache가 없거나 문제가 발생하더라도 기본 검색으로 돌아갈 수 있도록 구성해 새로운 기능 때문에 검색 자체가 멈추지 않도록 했습니다. 이러한 개선을 통해 SFM은 단순히 AI 기능을 계속 추가하는 방향보다
> 필요한 곳에만 AI를 사용하고,
> 이미 확인한 정보는 다시 활용하며,
> 기존 검색 품질을 보호하는 방향 으로 발전했습니다.
⑨ 🔐 업무자료를 다루기 때문에 개인정보 보호를 함께 설계했습니다
SFM을 개발하면서 성능만큼 중요하게 생각한 문제가 있습니다.
> “업무자료를 AI가 분석할 때 개인정보와 내부문서를 어떻게 보호할 것인가?”기업이나 업무환경에는
* 계약서
* 고객자료
* 개인정보
* 내부문서
* 이메일
처럼 외부 AI 서버로 그대로 보내기 부담스러운 자료가 많습니다.
그래서 SFM은 하나의 AI 방식만 강제하지 않습니다.
🖥️ Local AI
AI 모델을 사용자의 PC 내부에서 실행합니다.
문서 내용을 외부 AI 서버로 전송하지 않고 PC 안에서 분석할 수 있기 때문에
> “AI 검색은 사용하고 싶지만 회사자료를 외부로 보내고 싶지는 않다.”는 상황을 고려했습니다.
PC 성능에 따라 처리속도가 달라질 수 있지만 자료를 외부로 보내지 않고 AI 기능을 사용할 수 있다는 것이 가장 큰 장점입니다.
☁️ Cloud AI
더 높은 수준의 추론이 필요한 경우 Cloud AI를 선택할 수 있습니다.
그러나 Cloud AI를 사용한다고 해서 문서 전체와 개인정보를 그대로 외부로 전달하는 방식을 지향하지 않습니다.
AI 판단에 반드시 필요하지 않은 개인정보와 민감정보는 가능한 범위에서 마스킹하고, 필요한 정보만 제한적으로 전달하도록 설계했습니다.
🔄 Hybrid AI
Local과 Cloud를 단순히 절반씩 사용하는 방식이 아닙니다. 자료의 민감도와 질문의 성격에 따라
* 민감한 자료는 Local 중심으로 처리하고
* Cloud 사용이 가능한 경우에만 필요한 AI 추론을 활용하며
* 필요할 경우 결과를 서로 보완하도록구성했습니다.
즉 사용자가 속도 · AI 성능 · 개인정보 보호 중 자신의 상황에 맞는 방식을 선택할 수 있도록 했습니다.
⑩ 🌱 다른 사람도 따라 할 수 있나요?
가능하다고 생각합니다.저는 전문 개발자로 시작한 것이 아닙니다.
처음부터 복잡한 AI 기술이나 검색 알고리즘을 알고 있었던 것도 아닙니다.
제가 가장 먼저 한 것은 프로그래밍 공부가 아니라 “내가 실제로 불편한 문제가 무엇인가?”
를 구체적으로 정의하는 것이었습니다.
그리고 AI와 함께
**작은 기능 만들기**
↓
**직접 사용하기**
↓
**문제 발견하기**
↓
**측정하기**
↓
**원인 분석하기**
↓
**다시 개선하기**
를 반복했습니다.
SFM을 통해 보여주고 싶은 것은
> “AI가 개발자를 대신한다.”
는 이야기가 아닙니다.제가 보여주고 싶은 것은
> 전문 개발자가 아니더라도
> 자신이 잘 알고 있는 생활과 업무의 문제를 발견하고,
> AI와 협업하며 실제 결과를 측정하고 검증한다면
> 하나의 아이디어를 실제 사용할 수 있는 프로그램으로 발전시킬 수 있다는 가능성입니다.
🎯 SFM이 말하고 싶은 핵심
SFM은 단순히 AI가 파일을 찾아주는 프로그램을 목표로 하지 않습니다.
사용자가 기억나는 방식으로 질문하면
**기억의 단서**
↓
**사용자의 검색 경험**
↓
**검증된 검색 표현 Cache**
↓
**PC · NAS · Mail · Archive 검색**
↓
**Recall-First 후보 확보**
↓
**Evidence로 검색 이유 확인**
↓
**AI가 필요한 후보만 판단**
↓
**Selective RAG로 관련 내용 선별**
↓
**실제 자료를 근거로 답변**
↓
**원본 파일 확인**
까지 하나의 흐름으로 연결하는 것이 목표입니다.
자료가 많아질수록 모든 파일을 완벽하게 정리하는 것은 점점 어려워집니다.
하지만 사람은 여전히 사람 · 시기 · 장소 · 내용 · 파일 종류 · 당시 상황을 기억합니다.
SFM은 그 기억을 출발점으로 삼습니다.
자료를 새로운 곳으로 옮겨 정리하는 것이 아니라,이미 가지고 있는 자료로 다시 돌아가는 길을 만드는 것.
그것이 SFM입니다.
📁 어디에 저장했는지를 기억해야 하는 파일관리에서,
무엇을 기억하는지만으로 다시 찾는 파일관리로.
AI 시대의 자료관리,늘어나는 자료를 어떻게 저장할 것인가만큼 어떻게 다시 찾을 것인가가 중요합니다.
🤖 AI Tools Used
**ChatGPT · OpenAI Codex · Google Gemini · NotebookLM · Local AI**