AI가 다 만들어주는 시대, 이제 당신의 취향이 데이터가 됩니다
Quick Summary
AI가 결과물을 대량으로 만드는 시대에는 무엇을 왜 골랐는지 남기는 개인의 취향 데이터가 원하는 결과에 도달하는 중요한 판단 재료가 될 수 있다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
AI가 결과물을 대량으로 만드는 시대에는 무엇을 왜 골랐는지 남기는 개인의 취향 데이터가 원하는 결과에 도달하는 중요한 판단 재료가 될 수 있다.
📌 핵심 요점
- 취향은 단순한 호불호 기록이 아니라 맥락에 따른 선택 기준입니다. 기본 품질, 상황에 맞는 기준, 개인의 선호를 구분하고 작업 목적과 대상까지 함께 기록해야 한다.
- 인간의 비교 판단은 AI의 학습 신호가 될 수 있습니다. 영상은 인간 피드백을 활용한 강화 학습과 DPO를 소개하며, 선택된 결과뿐 아니라 같은 요청에서 비교한 후보도 중요하다고 설명한다.
- 연구자의 판단을 평가하는 테이스트 벤치마크는 전문가 선호와 모델 판단 사이의 간극을 보여주는 사례로 제시됩니다. 다만 연구 성공률을 측정한 결과가 아니며, 작은 표본과 특정 분야라는 한계가 있다.
- 개인화에 모델 재학습이 반드시 필요한 것은 아닙니다. 현재 작업과 관련된 과거 기록을 검색해 제공하는 접근부터 시작할 수 있으며, 기록의 양보다 적용 맥락과 검색의 적절성이 중요한다.
- 취향 데이터의 제품 가치는 실제 부담 감소로 검증해야 합니다. 선택 이유·확신·시간·수정 이력을 기록하고, 사용자가 기억을 수정·삭제·갱신할 수 있게 하며, 블라인드 비교와 수정 횟수 등으로 효과를 확인해야 한다.
🧩 배경과 문제 정의
AI가 많은 후보를 생성해도 최종 선택은 사람이 합니다. 코드는 작동하지만 화면이 답답하거나, 글은 매끈하지만 자신의 말투와 다르다고 느끼는 상황이 출발점입니다. 영상은 이 차이를 설명하는 테이스트를 취향·미감·좋은 방향을 알아보는 감각으로 소개한다.
문제는 좋아요나 클릭만으로는 어떤 조건에서 무엇을 왜 골랐는지 알기 어렵다는 점입니다. 영상은 기본 품질과 상황별 기준, 개인 선호를 구분하고, 관련 연구를 바탕으로 선택 과정의 기록과 활용 방법을 설명한다. 연구가 보여준 결과와 발표자의 제품 전망은 구분해서 다룹니다.
🕒 시간순 섹션별 상세정리
1. 생성 이후에 남는 선택의 문제
- AI가 결과물 100개를 만들어도 하나를 고르는 일은 사람에게 남습니다. 취향 데이터가 중요해질 수 있는 이유는 선택과 선택 이유가 AI의 판단 재료가 될 수 있기 때문입니다. [00:24]
- 홈페이지 사례로 기본 품질, 상황에 맞는 기준, 개인 선호를 구분합니다. 취향을 기록할 때는 무엇을 만들고 누구에게 보여주는지까지 붙여야 합니다. [01:46]
- 좋아하는 것과 잘한다고 평가하는 것은 다릅니다. 목표와 사람에 맞는 기준을 다뤄야 하며, 평균적으로 인기 있는 결과를 개인화로 간주해서는 안 됩니다. [02:13]
2. 가치 함수와 평가 기준의 역할
- 강화 학습의 가치 함수는 현재 상태에서 행동을 이어갈 때 기대할 수 있는 결과를 추정하는 개념으로 소개됩니다. 지금 받은 보상과 앞으로의 결과를 내다보는 가치는 구분됩니다. [02:32]
- 좋은 평가 기준은 완성 전에 후보를 좁혀 불필요한 시도를 줄일 수 있습니다. 다만 평가가 빠르고 충분히 정확해야 하며, 잘못된 조기 배제는 좋은 아이디어를 놓치게 할 수 있습니다. [03:02]
- 인간의 미감을 가치 함수와 동일시할 수 없고, 적은 토큰 사용도 취향 학습의 증거가 아닙니다. 핵심 질문은 생성 과정에 좋은 평가 신호를 넣을 수 있느냐입니다. [03:25]
3. 비교 판단을 학습하는 인간 피드백과 DPO
- 2020년 요약 연구는 사람이 두 요약을 비교한 데이터를 이용해 보상 모델을 학습하고, 그 모델이 높은 점수를 주는 요약을 생성하도록 언어 모델을 추가 학습한 사례로 소개됩니다. [03:55]
- 2023년 DPO는 선호된 답과 선호되지 않은 답의 쌍으로 언어 모델을 직접 학습하는 접근입니다. 제품 관점에서는 좋은 완성물뿐 아니라 사람들이 고른 과정도 수집할지가 중요해집니다. [04:27]
- 좋아요 기록만으로 바로 DPO를 적용할 수는 없습니다. 질문과 후보의 대응, 데이터 품질, 사용 권한이 필요하며, 소수의 개인 선택을 활용하려고 거대 모델을 반드시 재학습할 필요도 없습니다. [04:42]
4. 연구 방향을 고르는 테이스트 벤치마크
- 영상은 2026년 8월 공개된 테이스트를 AI의 안전 연구 제안 평가 능력을 살펴본 벤치마크로 소개합니다. 기준은 숙련된 연구자의 선호이며, 실제 미래 발견의 성공률을 추적한 평가는 아닙니다. [05:03]
- 토론과 높은 확신의 응답 선별을 함께 적용한 연구자 추정 일치율은 53%에서 68%로 상승했다고 보여준다. 최종 집합의 인간 일치율은 약 77%, 최고 모델 결과는 60%로 제시하지만, 작은 표본과 넓은 신뢰구간 때문에 순위나 정답률로 단정하지 말라고 강조한다. [05:55]
- 발표자는 선택 이유·확신·서로 다르게 이해한 조건까지 수집하자는 제품 아이디어를 도출합니다. 이는 연구 결과를 서비스 설계로 확장한 해석이며, 모든 취향을 하나로 통일하자는 제안이 아닙니다. [06:16]
5. 내부 표현과 행동 기준에 관한 연구
- 페르소나 벡터 연구는 일부 행동 성향과 연결된 신경망 활동 방향을 관찰·조절하고 데이터에 따른 성향 변화를 예측하는 접근으로 소개됩니다. 어시스턴트 축 연구는 역할 변화에 따른 내부 활동과 행동 안정화 개입을 다룹니다. [06:57]
- 감정 관련 내부 표현이 행동에 영향을 준다는 결과는 사람이 느끼는 것과 같은 주관적 경험의 증거가 아닙니다. 행동이 적절한 이유를 설명하는 데이터가 특정 정렬 평가 개선에 도움이 됐다는 연구도 소개됩니다. [07:27]
- 이 연구들은 표면적인 문체뿐 아니라 행동 선택 기준을 연구할 가능성을 보여준다. 최신 모델의 디자인 개선 원인이나 개인 취향의 완벽한 벡터 복제를 입증한 것은 아닙니다. [07:51]
6. 재학습 없이 시작하는 검색 기반 개인화
- 2024년 LaMP 논문은 분류 세 가지와 생성 네 가지의 개인화 과제를 제시한 연구로 소개됩니다. 현재 작업과 관련된 사용자 과거 항목을 검색해 언어 모델에 제공하는 접근을 실험했습니다. [08:28]
- 취향 메모와 예시를 대화 맥락에 넣는 일과 모델 가중치를 바꾸는 일은 다릅니다. 전자는 비교적 빠르게 수정할 수 있고, 후자는 데이터 양과 검증·관리 비용을 고려해야 합니다. [08:53]
- 기록을 많이 저장해도 부적절한 맥락의 기록을 가져오면 결과가 나빠질 수 있습니다. 개인화는 과거 전체를 붙이는 일이 아니라 지금 작업에 필요한 기준을 가져오는 문제입니다. [09:13]
7. 취향 데이터 한 건의 설계
- 발표자는 작업·목적·대상, 실제로 제시한 후보, 선택 결과를 함께 저장하자고 제안합니다. ‘둘 다 별로’, ‘둘 다 괜찮음’, ‘판단하기 어려움’을 허용해 애매한 판단이 강한 선호로 기록되지 않게 합니다. [09:44]
- 짧은 선택 이유와 확신·시간을 남기되, AI가 제안한 이유와 사용자가 확인한 이유를 구분해야 합니다. 무반응을 싫어함으로, 클릭을 선호 자체로 해석해서는 안 됩니다. [10:22]
- 사용자가 어떤 문장을 지우고 바꿨는지도 구체적인 신호가 될 수 있지만, 한 번의 수정으로 성향을 확정하지는 않습니다. 좋은 기록은 누가 어떤 맥락에서 무엇과 비교해 왜 골랐는지를 담습니다. [10:48]
8. 서비스 가치와 개인화의 설계 원칙
- 확인된 기준을 기억하는 서비스가 실제로 수정 횟수를 줄인다면 사용자는 그 기억을 가치 있게 느낄 수 있습니다. 여러 도구가 사용자 관리 기준을 참고하는 방향도 제안되지만, 사업성과 통일된 표준의 존재는 입증되지 않았습니다. [12:11]
- 과거 선호의 반복으로 탐색이 줄어드는 문제, 취향 맞추기가 아첨으로 변하는 문제, 긴 설문으로 수집 부담이 커지는 문제를 짚습니다. 취향 밖의 추천, 사실 우선, 결과를 바꿀 가능성이 큰 질문이 필요하다고 제안합니다. [13:02]
- 사용자는 저장 내용과 활용 목적을 확인하고, 틀린 기억을 수정하거나 적용 범위를 정하고 삭제할 수 있어야 합니다. 취향은 변하므로 예전 기록을 고정된 정체성처럼 다루지 않고 최근 선택과 직접 확인으로 갱신해야 합니다. [13:39]
9. 검증 방법과 준비 중인 서비스의 방향
- 같은 모델과 요청에서 취향 기록 사용 여부만 달리해 블라인드 비교하고, 표시 위치의 영향을 줄이자는 검증 방법을 제안합니다. 선택 비율뿐 아니라 수정 횟수·최종 채택 시간·재설명한 기준도 함께 봅니다. [14:06]
- 새 요청에 대한 적용, 사용자별 편차, 기록이 없는 첫날의 품질, 잘못된 기록 삭제의 영향도 확인해야 합니다. 이 지표들은 제안이며, 준비 중인 서비스가 이미 성과를 달성했다는 설명은 아닙니다. [14:42]
- 발표자는 선택 이유와 상황을 다음 작업에 활용하는 서비스를 준비 중이라고 밝히지만 이름과 출시 시점은 약속하지 않습니다. 반복해서 설명하는 취향과 불편한 순간을 댓글로 요청하고, 준비 과정과 연구 링크를 공유하겠다고 마무리합니다. [15:32]
🧾 결론
- 좋은 취향 데이터는 누가 어떤 상황에서 무엇과 비교해 왜 선택했는지를 함께 남기는 기록입니다. 판단 유보와 낮은 확신도 정보로 다뤄야 한다.
- 연구는 선호와 행동 기준을 학습하거나 활용할 가능성을 보여주지만, 개인의 취향을 완벽하게 복제하거나 모든 분야에 일반화할 수 있음을 증명하지는 않습니다.
- 개인화의 목적은 데이터 축적 자체가 아니라 사용자가 원하는 결과에 더 적은 설명과 수정으로 도달하도록 돕는 데 있다.
- 발표자가 준비 중인 서비스는 이러한 방향의 제안이며, 구체적인 서비스명·출시 시점·검증된 성과는 공개되지 않았습니다.
📈 투자·시사 포인트
- 생성 도구를 쉽게 사용할수록 원하는 결과를 고르는 과정과 확인된 선택 기준을 활용하는 능력이 서비스 차별화 요인이 될 수 있다는 전망입니다.
- 데이터가 많다는 사실만으로 사업성이 입증되지는 않습니다. 현재 작업에 유효한 기록을 가져오고 수정 횟수와 채택 시간을 줄이는지 확인해야 한다.
- 사용자가 관리하는 기준을 여러 도구가 필요한 범위에서 참고하는 제품 방향이 제시됩니다. 영상은 이를 이미 존재하는 통일된 표준으로 설명하지 않습니다.
- 기업용 활용에서는 개인의 호불호와 팀의 품질 기준을 구분해야 합니다. 기준을 확인하고 고치며 결과 개선을 체감하는 관계가 경쟁력의 조건으로 제안된다.
⚠️ 불확실하거나 확인이 필요한 부분
- 테이스트 벤치마크의 공개 시점, 모델명, 비교 집합 구성과 수치는 원문 확인이 필요합니다. 영상은 연구자 추정 일치율 53%→68%, 최종 집합 약 77%, 최고 모델 결과 60%를 소개하지만, 전사에 일부 고유명사와 표현의 불명확함이 있다.
- 위 수치는 미래 연구의 성공률이나 보편적인 취향 판단 능력을 뜻하지 않습니다. 영상도 모델별 신뢰구간이 대략 10%포인트 안팎으로 넓고 안전 연구 제안이라는 특정 분야에 한정된다고 설명한다.
- 해석 가능성 연구가 최신 모델의 디자인 품질을 높였다는 인과관계, 개인 취향을 벡터 하나로 복제할 수 있다는 주장은 확인되지 않았습니다. 감정 관련 내부 표현도 주관적 경험의 증거로 해석해서는 안 된다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 반복해서 설명하는 취향 한 가지를 정하고, 작업 목적·대상·비교 후보·선택·이유·확신·시간을 함께 기록한다.
- 선택 항목에 ‘둘 다 별로’, ‘둘 다 괜찮음’, ‘판단하기 어려움’을 포함하고, 직접 작성한 이유와 AI가 제안한 이유를 구분한다.
- 글쓰기·디자인·업무용 문서 등 적용 범위를 나누고, 현재 작업과 관련된 기록을 검색해 제공하는 방식부터 시험한다.
- 같은 모델과 같은 요청에서 취향 기록 사용 여부만 달리한 결과를 블라인드로 비교하고, 표시 위치의 영향을 줄입니다.
❓ 열린 질문
- 어떤 작업에서 취향 기록이 실제로 수정 횟수와 채택 시간을 줄이며, 효과를 내려면 어느 정도의 기록이 필요할까요?
- 과거 선호를 반영하면서 새로운 가능성을 발견할 기회도 남기려면 개인화와 탐색을 어떻게 조절해야 할까요?
- 여러 도구가 사용자의 기준을 참고할 때, 기록의 적용 범위와 갱신을 사용자가 어떻게 관리할 수 있을까요?