Docs faviconDOCS우성짱의 문서
전체YouTubeArticleTagsAuthorsHub
홈/태그 찾기/#ai-architecture
Tag508건YouTube 42Article 466

#ai-architecture

이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.

연관 태그

#llm공동문서 421 · 연관도 51%#applications공동문서 315 · 연관도 42%#semiconductors공동문서 295 · 연관도 37%#agent-routing공동문서 190 · 연관도 36%#service-design공동문서 131 · 연관도 30%#agent-memory공동문서 160 · 연관도 30%#multimodal공동문서 85 · 연관도 26%#vision-language-models공동문서 82 · 연관도 26%#retrieval-index공동문서 87 · 연관도 24%#gpu공동문서 48 · 연관도 24%
Timm ❤️ Transformers: Use any timm model with transformers
Article2025년 1월 15일

Timm ❤️ Transformers: Use any timm model with transformers

TimmWrapper는 방대한 timm 비전 모델을 Transformers의 파이프라인, 자동 클래스, 양자화, Trainer, LoRA 워크플로에서 사용하고 다시 timm으로 불러올 수 있게 연결합니다.

huggingface.co
#ai-architecture#agent-memory#agent-routing#context-compression
Vision Language Models (Better, faster, stronger)
Article2025년 1월 12일

Vision Language Models (Better, faster, stronger)

지난 1년간 비전 언어 모델은 다중 모달 입출력, 추론, 소형화, 전문가 혼합 구조, 로봇 행동 제어와 전통적 시각 작업의 통합을 중심으로 더 강력하고 효율적인 형태로 발전했다.

huggingface.co
#privacy-design#ai-architecture#multimodal#agent-deployment
State of open video generation models in Diffusers
Article2025년 1월 8일

State of open video generation models in Diffusers

오픈 비디오 생성 모델은 빠르게 발전하고 있지만 높은 메모리 요구량, 긴 생성 시간, 제한적인 일반화가 확산을 가로막고 있으며, 디퓨저스는 양자화·오프로딩·분할 추론을 조합해 이러한 모델을 더 적은 자원에서 실행할 수 있도록 지원한다.

huggingface.co
#ai-architecture#agent-memory#context-compression#retrieval-index
Mastering Long Contexts in LLMs with KVPress
Article2024년 12월 21일

Mastering Long Contexts in LLMs with KVPress

KVPress는 긴 문맥에서 선형으로 증가하는 키·값 캐시를 중요도 기반으로 압축해 메모리 사용량을 줄이고 생성 속도를 높이는 모듈형 도구다.

huggingface.co
#ai-architecture#multimodal#agent-memory#context-compression
Welcome to the Falcon 3 Family of Open Models!
Article2024년 12월 17일

Welcome to the Falcon 3 Family of Open Models!

팰컨3는 10억~100억 매개변수 규모에서 과학·수학·코딩·추론 성능과 학습 효율을 함께 높이고, 다양한 배포 형식과 개방형 라이선스를 제공하는 디코더 전용 언어 모델 제품군이다.

huggingface.co
#ai-architecture#llm#semiconductors#applications
Elon Musk wanted an OpenAI for-profit
Article2024년 12월 13일

Elon Musk wanted an OpenAI for-profit

오픈AI는 일론 머스크가 영리 구조 자체에 반대했던 것이 아니라 2017년 영리 전환을 추진하면서 지분 과반, 절대적 통제권, 최고경영자 지위를 요구했고, 그 조건이 받아들여지지 않자 회사를 떠났다고 주장한다.

openai.com
#openai#privacy-design#ai-architecture#agent-routing
Sora System Card
Article2024년 12월 9일

Sora System Card

Sora는 텍스트·이미지·영상을 입력받아 최대 1080p·20초 영상을 생성하거나 편집하는 모델이며, OpenAI는 데이터 필터링, 외부 레드팀, 내부 평가, 입출력 분류기와 제품 제한을 결합해 오용 위험을 줄이고자 했다.

openai.com
#openai#privacy-design#ai-architecture#multimodal
Fast LoRA inference for Flux with Diffusers and PEFT
Article2024년 12월 5일

Fast LoRA inference for Flux with Diffusers and PEFT

Diffusers와 PEFT의 LoRA 핫스와핑, torch.compile, FP8 양자화, Flash Attention 3를 조합해 Flux.1 Dev의 재컴파일 문제를 피하고 고성능 GPU에서 약 2.23배, RTX 4090에서 약 2.04배 빠른 LoRA 추론을 구현한 최적화 방법을 설명한다.

huggingface.co
#ai-architecture#agent-memory#agent-routing#context-compression
Going local-first with Automerge and Convex
Article2024년 11월 19일

Going local-first with Automerge and Convex

이 글은 Automerge의 CRDT 기반 로컬 우선 편집 모델과 Convex 백엔드를 함께 사용해 오프라인 편집, 충돌 없는 협업, 서버 기반 권한·관계·동기화를 결합하는 방법을 설명한다.

stack.convex.dev
#ai-architecture#agent-routing#llm#semiconductors
An Object Sync Engine for Local-first Apps
Article2024년 11월 13일

An Object Sync Engine for Local-first Apps

이 글은 로컬 퍼스트 웹 앱에 적합한 객체 동기화 엔진을 정의하고, 로컬 저장소·서버 저장소·동기화 프로토콜의 역할을 기존 사례와 컨벡스의 방향으로 비교한다.

stack.convex.dev
#service-design#ai-architecture#agent-memory#retrieval-index
Data-driven beauty: How The Estée Lauder Companies unlocks insights with ChatGPT
Article2024년 11월 13일

Data-driven beauty: How The Estée Lauder Companies unlocks insights with ChatGPT

에스티 로더 컴퍼니즈는 ChatGPT Enterprise와 사내 GPT Lab을 활용해 방대한 소비자·임상 데이터를 빠르게 분석하고, 직원의 반복 업무를 줄이면서 제품 개발과 마케팅의 창의성 및 시장 대응 속도를 높였다.

openai.com
#openai#privacy-design#ai-architecture#agent-memory
Rearchitecting Hugging Face Uploads and Downloads
Article2024년 9월 27일

Rearchitecting Hugging Face Uploads and Downloads

허깅페이스는 대용량 모델·데이터셋 전송의 한계를 극복하기 위해 바이트 단위 중복 제거와 검증을 수행하는 콘텐츠 주소 기반 저장소(CAS)를 도입하고, 전 세계 업로드 분포에 맞춰 세 지역에 노드를 배치하는 새로운 업로드·다운로드 구조를 설계했다.

huggingface.co
#service-design#ai-architecture#llm#semiconductors
Bamba: Inference-Efficient Hybrid Mamba2 Model
Article2024년 9월 25일

Bamba: Inference-Efficient Hybrid Mamba2 Model

Bamba 9B는 KV cache 병목을 줄이기 위해 Mamba2와 트랜스포머를 결합한 9B급 하이브리드 모델로, 공개 데이터로 학습되고 주요 오픈소스 추론·학습 생태계에서 바로 실험할 수 있도록 공개된 모델이다.

huggingface.co
#model-scaling#ai-architecture#agent-memory#context-compression
Welcome the NVIDIA Llama Nemotron Nano VLM to Hugging Face Hub
Article2024년 9월 25일

Welcome the NVIDIA Llama Nemotron Nano VLM to Hugging Face Hub

엔비디아 라마 네모트론 나노 VL은 복잡한 문서의 문자·표·차트·수식·배치를 정밀하게 인식하고 위치 정보까지 제공하도록 설계된 80억 매개변수급 시각언어모델이다.

huggingface.co
#nvidia#ai-architecture#multimodal#agent-routing
Expert Support case study: Bolstering a RAG app with LLM-as-a-Judge
Article2024년 9월 13일

Expert Support case study: Bolstering a RAG app with LLM-as-a-Judge

Digital Green은 농업 RAG 챗봇 Farmer.chat의 응답 품질을 대규모로 평가하기 위해 LLM as a Judge 체계를 구축하고, 충실도와 답변률의 균형을 기준으로 생성 모델을 비교·선정했다.

huggingface.co
#service-design#ai-architecture#agent-memory#context-compression
Handling 300k requests per day: an adventure in scaling
Article2024년 9월 13일

Handling 300k requests per day: an adventure in scaling

Firecrawl 팀은 사용자 증가로 API와 크롤링 작업이 불안정해지자 큐 락 설정, 스크레이프 처리 구조, 크롤 작업 단위, 큐 라이브러리, Redis 인프라를 단계적으로 바꾸며 하루 30만 요청 규모에 대응했다.

firecrawl.dev
#privacy-design#service-design#ai-architecture#agent-routing
Train 400x faster Static Embedding Models with Sentence Transformers
Article2024년 8월 9일

Train 400x faster Static Embedding Models with Sentence Transformers

이 글은 Sentence Transformers로 정적 임베딩 모델을 현대식 대조학습과 Matryoshka Representation Learning으로 학습해 CPU 추론 속도를 기존 주요 임베딩 모델보다 100~400배 높이면서도 여러 벤치마크에서 성능의 상당 부분을 유지하는 방법을 소개한다.

huggingface.co
#luxury-hospitality#luxury-travel#ai-architecture#multimodal
Introducing SyGra Studio
Article2024년 4월 4일

Introducing SyGra Studio

SyGra Studio는 합성 데이터 생성 흐름을 시각적으로 구성하고, 생성되는 설정과 실행 상태·비용·결과를 한 화면에서 확인할 수 있게 만든 대화형 작업 환경이다.

huggingface.co
#ai-architecture#agent-routing#context-compression#prompt-library
Algorithmic progress in language models
Article2024년 3월 12일

Algorithmic progress in language models

Epoch AI는 사전학습 언어모델에서 같은 성능에 필요한 컴퓨트가 약 8개월마다 절반으로 줄었지만, 지난 10년의 성능 향상은 알고리즘 혁신보다 컴퓨트와 데이터 확장의 영향이 더 컸다고 분석한다.

Anson Ho
#model-scaling#ai-architecture#capex-cycle#llm
Welcome EmbeddingGemma, Google's new efficient embedding model
Article2024년 2월 21일

Welcome EmbeddingGemma, Google's new efficient embedding model

임베딩젬마는 3억 800만 개 매개변수와 2,048토큰 문맥 길이, 100개 이상 언어 지원, 차원 축소 기능을 결합해 일상적인 기기에서도 고품질 다국어 임베딩을 생성하도록 설계된 구글의 소형 모델이다.

huggingface.co
#ai-architecture#agent-memory#agent-routing#search-advertising
Training and Finetuning Sparse Embedding Models with Sentence Transformers
Article2024년 2월 19일

Training and Finetuning Sparse Embedding Models with Sentence Transformers

이 글은 Sentence Transformers로 희소 임베딩 모델을 미세조정하는 이유와 기본 구성요소를 설명하며, SPLADE 계열 모델의 해석 가능성·확장 방식·도메인 적응 필요성을 실용 예제로 보여준다.

huggingface.co
#ai-architecture#multimodal#llm#vision-language-models
No GPU left behind: Unlocking Efficiency with Co-located vLLM in TRL
Article2024년 2월 5일

No GPU left behind: Unlocking Efficiency with Co-located vLLM in TRL

TRL의 co located vLLM은 GRPO의 학습과 생성을 동일한 GPU·분산 프로세스 그룹에서 번갈아 실행해 유휴 시간과 통신 비용을 줄이며, 모델 크기와 텐서 병렬화 설정에 따라 최대 1.73배의 처리량 향상을 보였다.

huggingface.co
#ai-architecture#multimodal#agent-routing#capex-cycle
Why AI Will Save the World
Article2023년 6월 6일

Why AI Will Save the World

마크 안드리센은 AI를 인간 지능을 증강해 교육·과학·경제·예술·의사결정을 개선할 도구로 보고, 현재의 AI 공포와 규제 요구를 역사적 기술 도덕 공황 및 이해관계의 산물로 비판한다.

Marc Andreessen
#ai-architecture#change-management#organizational-redesign#travel-hospitality
AI Canon
Article2023년 5월 25일

AI Canon

a16z의 ‘AI Canon’은 현대 AI를 이해하기 위해 영향력이 컸던 논문, 글, 강의, 실무 가이드, 시장 분석 자료를 단계별로 묶은 선별 참고 목록이다.

Derrick Harris, Matt Bornstein, Guido Appenzeller
#anthropic#privacy-design#ai-architecture#agent-routing
이전1…1920212221 / 22다음