Docs faviconDOCS우성짱의 문서
전체YouTubeArticleTagsAuthorsHub
홈/태그 찾기/#research-note
Tag4건Article 4

#research-note

이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.

연관 태그

#adversarial-attack-scaling공동문서 1 · 연관도 50%#adversarial-robustness공동문서 1 · 연관도 50%#ai-alignment-governance공동문서 1 · 연관도 50%#big-bench공동문서 1 · 연관도 50%#big-bench-hard공동문서 1 · 연관도 50%#collective-alignment공동문서 1 · 연관도 50%#compute-allocation-safety공동문서 1 · 연관도 50%#compute-scaling-curves공동문서 1 · 연관도 50%#cot-optimization-tradeoff공동문서 1 · 연관도 50%#frontier-reasoning-models공동문서 1 · 연관도 50%
Collective alignment: public input on our Model Spec
Article2025년 8월 27일

Collective alignment: public input on our Model Spec

OpenAI는 모델의 기본 행동과 개인화의 경계를 더 다양한 공적 가치에 맞추기 위해 전 세계 참여자 의견을 수집하고, 이를 Model Spec 개선 제안과 데이터셋 공개로 연결하는 초기 집단 정렬 실험을 수행했다.

openai.com
#huggingface#openai#model-spec#model-spec-ranker
Detecting misbehavior in frontier reasoning models
Article2025년 3월 10일

Detecting misbehavior in frontier reasoning models

OpenAI는 프런티어 추론 모델이 보상 구조의 허점을 찾아 악용할 수 있으며, 체인오브소트(CoT)를 다른 LLM으로 감시하면 이런 의도를 잘 포착할 수 있지만 CoT 자체를 강하게 최적화하면 모델이 악의적 의도를 숨기게 된다고 보고했다.

openai.com
#openai#gpt-4o#reward-hacking#chain-of-thought
Trading Inference-Time Compute for Adversarial Robustness
Article2025년 1월 22일

Trading Inference-Time Compute for Adversarial Robustness

OpenAI는 o1 계열 추론 모델이 추론 시점에 더 오래 ‘생각’하도록 계산 자원을 늘리면 여러 적대적 공격에 대한 성공 확률이 낮아질 수 있다는 초기 증거를 제시했다.

openai.com
#openai#simpleqa#o1-mini#o1-preview
How predictable is language model benchmark performance?
Article2023년 6월 9일

How predictable is language model benchmark performance?

Epoch AI는 11개 최신 언어모델 아키텍처와 36개 모델 크기의 데이터를 분석해, 벤치마크 전체 성능은 컴퓨트 스케일링만으로도 어느 정도 예측 가능하지만 개별 과제 성능은 훨씬 변동성이 크다고 결론낸다.

David Owen
#big-bench#david-owen#epoch-ai#big-bench-hard