YouTube메이커 에반·2026년 10월 1일·0

AI가 다 만들어주는 시대, 이제 당신의 취향이 데이터가 됩니다

Quick Summary

AI가 결과물을 대량으로 만드는 시대에는 무엇을 왜 골랐는지 남기는 개인의 취향 데이터가 원하는 결과에 도달하는 중요한 판단 재료가 될 수 있다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

AI가 다 만들어주는 시대, 이제 당신의 취향이 데이터가 됩니다 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

AI가 다 만들어주는 시대, 이제 당신의 취향이 데이터가 됩니다의 핵심 내용을 4단계로 요약한 인포그래픽
AI가 다 만들어주는 시대, 이제 당신의 취향이 데이터가 됩니다 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

AI가 결과물을 대량으로 만드는 시대에는 무엇을 왜 골랐는지 남기는 개인의 취향 데이터가 원하는 결과에 도달하는 중요한 판단 재료가 될 수 있다.

📌 핵심 요점

  1. 취향은 단순한 호불호 기록이 아니라 맥락에 따른 선택 기준입니다. 기본 품질, 상황에 맞는 기준, 개인의 선호를 구분하고 작업 목적과 대상까지 함께 기록해야 한다.
  2. 인간의 비교 판단은 AI의 학습 신호가 될 수 있습니다. 영상은 인간 피드백을 활용한 강화 학습과 DPO를 소개하며, 선택된 결과뿐 아니라 같은 요청에서 비교한 후보도 중요하다고 설명한다.
  3. 연구자의 판단을 평가하는 테이스트 벤치마크는 전문가 선호와 모델 판단 사이의 간극을 보여주는 사례로 제시됩니다. 다만 연구 성공률을 측정한 결과가 아니며, 작은 표본과 특정 분야라는 한계가 있다.
  4. 개인화에 모델 재학습이 반드시 필요한 것은 아닙니다. 현재 작업과 관련된 과거 기록을 검색해 제공하는 접근부터 시작할 수 있으며, 기록의 양보다 적용 맥락과 검색의 적절성이 중요한다.
  5. 취향 데이터의 제품 가치는 실제 부담 감소로 검증해야 합니다. 선택 이유·확신·시간·수정 이력을 기록하고, 사용자가 기억을 수정·삭제·갱신할 수 있게 하며, 블라인드 비교와 수정 횟수 등으로 효과를 확인해야 한다.

🧩 배경과 문제 정의

AI가 많은 후보를 생성해도 최종 선택은 사람이 합니다. 코드는 작동하지만 화면이 답답하거나, 글은 매끈하지만 자신의 말투와 다르다고 느끼는 상황이 출발점입니다. 영상은 이 차이를 설명하는 테이스트를 취향·미감·좋은 방향을 알아보는 감각으로 소개한다.

문제는 좋아요나 클릭만으로는 어떤 조건에서 무엇을 왜 골랐는지 알기 어렵다는 점입니다. 영상은 기본 품질과 상황별 기준, 개인 선호를 구분하고, 관련 연구를 바탕으로 선택 과정의 기록과 활용 방법을 설명한다. 연구가 보여준 결과와 발표자의 제품 전망은 구분해서 다룹니다.

🕒 시간순 섹션별 상세정리

1. 생성 이후에 남는 선택의 문제

  • AI가 결과물 100개를 만들어도 하나를 고르는 일은 사람에게 남습니다. 취향 데이터가 중요해질 수 있는 이유는 선택과 선택 이유가 AI의 판단 재료가 될 수 있기 때문입니다. [00:24]
  • 홈페이지 사례로 기본 품질, 상황에 맞는 기준, 개인 선호를 구분합니다. 취향을 기록할 때는 무엇을 만들고 누구에게 보여주는지까지 붙여야 합니다. [01:46]
  • 좋아하는 것과 잘한다고 평가하는 것은 다릅니다. 목표와 사람에 맞는 기준을 다뤄야 하며, 평균적으로 인기 있는 결과를 개인화로 간주해서는 안 됩니다. [02:13]

2. 가치 함수와 평가 기준의 역할

  • 강화 학습의 가치 함수는 현재 상태에서 행동을 이어갈 때 기대할 수 있는 결과를 추정하는 개념으로 소개됩니다. 지금 받은 보상과 앞으로의 결과를 내다보는 가치는 구분됩니다. [02:32]
  • 좋은 평가 기준은 완성 전에 후보를 좁혀 불필요한 시도를 줄일 수 있습니다. 다만 평가가 빠르고 충분히 정확해야 하며, 잘못된 조기 배제는 좋은 아이디어를 놓치게 할 수 있습니다. [03:02]
  • 인간의 미감을 가치 함수와 동일시할 수 없고, 적은 토큰 사용도 취향 학습의 증거가 아닙니다. 핵심 질문은 생성 과정에 좋은 평가 신호를 넣을 수 있느냐입니다. [03:25]

3. 비교 판단을 학습하는 인간 피드백과 DPO

  • 2020년 요약 연구는 사람이 두 요약을 비교한 데이터를 이용해 보상 모델을 학습하고, 그 모델이 높은 점수를 주는 요약을 생성하도록 언어 모델을 추가 학습한 사례로 소개됩니다. [03:55]
  • 2023년 DPO는 선호된 답과 선호되지 않은 답의 쌍으로 언어 모델을 직접 학습하는 접근입니다. 제품 관점에서는 좋은 완성물뿐 아니라 사람들이 고른 과정도 수집할지가 중요해집니다. [04:27]
  • 좋아요 기록만으로 바로 DPO를 적용할 수는 없습니다. 질문과 후보의 대응, 데이터 품질, 사용 권한이 필요하며, 소수의 개인 선택을 활용하려고 거대 모델을 반드시 재학습할 필요도 없습니다. [04:42]

4. 연구 방향을 고르는 테이스트 벤치마크

  • 영상은 2026년 8월 공개된 테이스트를 AI의 안전 연구 제안 평가 능력을 살펴본 벤치마크로 소개합니다. 기준은 숙련된 연구자의 선호이며, 실제 미래 발견의 성공률을 추적한 평가는 아닙니다. [05:03]
  • 토론과 높은 확신의 응답 선별을 함께 적용한 연구자 추정 일치율은 53%에서 68%로 상승했다고 보여준다. 최종 집합의 인간 일치율은 약 77%, 최고 모델 결과는 60%로 제시하지만, 작은 표본과 넓은 신뢰구간 때문에 순위나 정답률로 단정하지 말라고 강조한다. [05:55]
  • 발표자는 선택 이유·확신·서로 다르게 이해한 조건까지 수집하자는 제품 아이디어를 도출합니다. 이는 연구 결과를 서비스 설계로 확장한 해석이며, 모든 취향을 하나로 통일하자는 제안이 아닙니다. [06:16]

5. 내부 표현과 행동 기준에 관한 연구

  • 페르소나 벡터 연구는 일부 행동 성향과 연결된 신경망 활동 방향을 관찰·조절하고 데이터에 따른 성향 변화를 예측하는 접근으로 소개됩니다. 어시스턴트 축 연구는 역할 변화에 따른 내부 활동과 행동 안정화 개입을 다룹니다. [06:57]
  • 감정 관련 내부 표현이 행동에 영향을 준다는 결과는 사람이 느끼는 것과 같은 주관적 경험의 증거가 아닙니다. 행동이 적절한 이유를 설명하는 데이터가 특정 정렬 평가 개선에 도움이 됐다는 연구도 소개됩니다. [07:27]
  • 이 연구들은 표면적인 문체뿐 아니라 행동 선택 기준을 연구할 가능성을 보여준다. 최신 모델의 디자인 개선 원인이나 개인 취향의 완벽한 벡터 복제를 입증한 것은 아닙니다. [07:51]

6. 재학습 없이 시작하는 검색 기반 개인화

  • 2024년 LaMP 논문은 분류 세 가지와 생성 네 가지의 개인화 과제를 제시한 연구로 소개됩니다. 현재 작업과 관련된 사용자 과거 항목을 검색해 언어 모델에 제공하는 접근을 실험했습니다. [08:28]
  • 취향 메모와 예시를 대화 맥락에 넣는 일과 모델 가중치를 바꾸는 일은 다릅니다. 전자는 비교적 빠르게 수정할 수 있고, 후자는 데이터 양과 검증·관리 비용을 고려해야 합니다. [08:53]
  • 기록을 많이 저장해도 부적절한 맥락의 기록을 가져오면 결과가 나빠질 수 있습니다. 개인화는 과거 전체를 붙이는 일이 아니라 지금 작업에 필요한 기준을 가져오는 문제입니다. [09:13]

7. 취향 데이터 한 건의 설계

  • 발표자는 작업·목적·대상, 실제로 제시한 후보, 선택 결과를 함께 저장하자고 제안합니다. ‘둘 다 별로’, ‘둘 다 괜찮음’, ‘판단하기 어려움’을 허용해 애매한 판단이 강한 선호로 기록되지 않게 합니다. [09:44]
  • 짧은 선택 이유와 확신·시간을 남기되, AI가 제안한 이유와 사용자가 확인한 이유를 구분해야 합니다. 무반응을 싫어함으로, 클릭을 선호 자체로 해석해서는 안 됩니다. [10:22]
  • 사용자가 어떤 문장을 지우고 바꿨는지도 구체적인 신호가 될 수 있지만, 한 번의 수정으로 성향을 확정하지는 않습니다. 좋은 기록은 누가 어떤 맥락에서 무엇과 비교해 왜 골랐는지를 담습니다. [10:48]

8. 서비스 가치와 개인화의 설계 원칙

  • 확인된 기준을 기억하는 서비스가 실제로 수정 횟수를 줄인다면 사용자는 그 기억을 가치 있게 느낄 수 있습니다. 여러 도구가 사용자 관리 기준을 참고하는 방향도 제안되지만, 사업성과 통일된 표준의 존재는 입증되지 않았습니다. [12:11]
  • 과거 선호의 반복으로 탐색이 줄어드는 문제, 취향 맞추기가 아첨으로 변하는 문제, 긴 설문으로 수집 부담이 커지는 문제를 짚습니다. 취향 밖의 추천, 사실 우선, 결과를 바꿀 가능성이 큰 질문이 필요하다고 제안합니다. [13:02]
  • 사용자는 저장 내용과 활용 목적을 확인하고, 틀린 기억을 수정하거나 적용 범위를 정하고 삭제할 수 있어야 합니다. 취향은 변하므로 예전 기록을 고정된 정체성처럼 다루지 않고 최근 선택과 직접 확인으로 갱신해야 합니다. [13:39]

9. 검증 방법과 준비 중인 서비스의 방향

  • 같은 모델과 요청에서 취향 기록 사용 여부만 달리해 블라인드 비교하고, 표시 위치의 영향을 줄이자는 검증 방법을 제안합니다. 선택 비율뿐 아니라 수정 횟수·최종 채택 시간·재설명한 기준도 함께 봅니다. [14:06]
  • 새 요청에 대한 적용, 사용자별 편차, 기록이 없는 첫날의 품질, 잘못된 기록 삭제의 영향도 확인해야 합니다. 이 지표들은 제안이며, 준비 중인 서비스가 이미 성과를 달성했다는 설명은 아닙니다. [14:42]
  • 발표자는 선택 이유와 상황을 다음 작업에 활용하는 서비스를 준비 중이라고 밝히지만 이름과 출시 시점은 약속하지 않습니다. 반복해서 설명하는 취향과 불편한 순간을 댓글로 요청하고, 준비 과정과 연구 링크를 공유하겠다고 마무리합니다. [15:32]

🧾 결론

  • 좋은 취향 데이터는 누가 어떤 상황에서 무엇과 비교해 왜 선택했는지를 함께 남기는 기록입니다. 판단 유보와 낮은 확신도 정보로 다뤄야 한다.
  • 연구는 선호와 행동 기준을 학습하거나 활용할 가능성을 보여주지만, 개인의 취향을 완벽하게 복제하거나 모든 분야에 일반화할 수 있음을 증명하지는 않습니다.
  • 개인화의 목적은 데이터 축적 자체가 아니라 사용자가 원하는 결과에 더 적은 설명과 수정으로 도달하도록 돕는 데 있다.
  • 발표자가 준비 중인 서비스는 이러한 방향의 제안이며, 구체적인 서비스명·출시 시점·검증된 성과는 공개되지 않았습니다.

📈 투자·시사 포인트

  • 생성 도구를 쉽게 사용할수록 원하는 결과를 고르는 과정과 확인된 선택 기준을 활용하는 능력이 서비스 차별화 요인이 될 수 있다는 전망입니다.
  • 데이터가 많다는 사실만으로 사업성이 입증되지는 않습니다. 현재 작업에 유효한 기록을 가져오고 수정 횟수와 채택 시간을 줄이는지 확인해야 한다.
  • 사용자가 관리하는 기준을 여러 도구가 필요한 범위에서 참고하는 제품 방향이 제시됩니다. 영상은 이를 이미 존재하는 통일된 표준으로 설명하지 않습니다.
  • 기업용 활용에서는 개인의 호불호와 팀의 품질 기준을 구분해야 합니다. 기준을 확인하고 고치며 결과 개선을 체감하는 관계가 경쟁력의 조건으로 제안된다.

⚠️ 불확실하거나 확인이 필요한 부분

  • 테이스트 벤치마크의 공개 시점, 모델명, 비교 집합 구성과 수치는 원문 확인이 필요합니다. 영상은 연구자 추정 일치율 53%→68%, 최종 집합 약 77%, 최고 모델 결과 60%를 소개하지만, 전사에 일부 고유명사와 표현의 불명확함이 있다.
  • 위 수치는 미래 연구의 성공률이나 보편적인 취향 판단 능력을 뜻하지 않습니다. 영상도 모델별 신뢰구간이 대략 10%포인트 안팎으로 넓고 안전 연구 제안이라는 특정 분야에 한정된다고 설명한다.
  • 해석 가능성 연구가 최신 모델의 디자인 품질을 높였다는 인과관계, 개인 취향을 벡터 하나로 복제할 수 있다는 주장은 확인되지 않았습니다. 감정 관련 내부 표현도 주관적 경험의 증거로 해석해서는 안 된다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 반복해서 설명하는 취향 한 가지를 정하고, 작업 목적·대상·비교 후보·선택·이유·확신·시간을 함께 기록한다.
  • 선택 항목에 ‘둘 다 별로’, ‘둘 다 괜찮음’, ‘판단하기 어려움’을 포함하고, 직접 작성한 이유와 AI가 제안한 이유를 구분한다.
  • 글쓰기·디자인·업무용 문서 등 적용 범위를 나누고, 현재 작업과 관련된 기록을 검색해 제공하는 방식부터 시험한다.
  • 같은 모델과 같은 요청에서 취향 기록 사용 여부만 달리한 결과를 블라인드로 비교하고, 표시 위치의 영향을 줄입니다.

❓ 열린 질문

  • 어떤 작업에서 취향 기록이 실제로 수정 횟수와 채택 시간을 줄이며, 효과를 내려면 어느 정도의 기록이 필요할까요?
  • 과거 선호를 반영하면서 새로운 가능성을 발견할 기회도 남기려면 개인화와 탐색을 어떻게 조절해야 할까요?
  • 여러 도구가 사용자의 기준을 참고할 때, 기록의 적용 범위와 갱신을 사용자가 어떻게 관리할 수 있을까요?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.