Docs faviconDOCS우성짱의 문서
전체YouTubeArticleTagsAuthorsHub
홈/태그 찾기/#ai-architecture
Tag508건YouTube 42Article 466

#ai-architecture

이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.

연관 태그

#llm공동문서 421 · 연관도 51%#applications공동문서 315 · 연관도 42%#semiconductors공동문서 295 · 연관도 37%#agent-routing공동문서 190 · 연관도 36%#service-design공동문서 131 · 연관도 30%#agent-memory공동문서 160 · 연관도 30%#multimodal공동문서 85 · 연관도 26%#vision-language-models공동문서 82 · 연관도 26%#retrieval-index공동문서 87 · 연관도 24%#gpu공동문서 48 · 연관도 24%
Exploring Quantization Backends in Diffusers
Article2025년 6월 27일

Exploring Quantization Backends in Diffusers

Diffusers는 Flux의 핵심 구성 요소를 여러 백엔드로 양자화해 이미지 품질을 크게 훼손하지 않으면서 메모리 사용량을 줄일 수 있으며, 정밀도와 백엔드에 따라 속도·메모리·사용 편의성의 차이가 뚜렷하다.

huggingface.co
#ai-architecture#multimodal#agent-memory#context-compression
How Long Prompts Block Other Requests - Optimizing LLM Performance
Article2025년 6월 12일

How Long Prompts Block Other Requests - Optimizing LLM Performance

긴 프롬프트가 포함된 요청은 프리필 대기열과 동시 디코딩을 지연시키며, 요청 병렬 프리필은 첫 토큰 지연을 줄이고 프리필·디코드 분리 구조는 토큰 생성 간섭을 완화한다.

huggingface.co
#ai-architecture#agent-deployment#agent-routing#workflow-automation
Holo1: New family of GUI automation VLMs powering GUI agent Surfer-H
Article2025년 6월 9일

Holo1: New family of GUI automation VLMs powering GUI agent Surfer-H

H Company는 웹 UI를 이해하고 클릭 위치를 정밀하게 찾는 오픈소스 액션 비전 언어 모델 Holo1과 1,639개 UI 과제로 구성된 WebClick 벤치마크를 공개했으며, 이를 기반으로 브라우저 자동화 에이전트 Surfer H를 구동한다고 밝혔다.

huggingface.co
#ai-architecture#multimodal#workflow-automation#llm
KV Cache from scratch in nanoVLM
Article2025년 6월 4일

KV Cache from scratch in nanoVLM

나노브이엘엠에 계층별 키·값 캐시와 사전 채움·순차 해독 구조를 직접 구현해, 자기회귀 생성의 중복 계산을 줄이고 생성 속도를 38% 높인 과정과 원리를 설명한다.

huggingface.co
#ai-architecture#multimodal#agent-memory#retrieval-index
AI Agents (and humans) do better with good abstractions
Article2025년 6월 3일

AI Agents (and humans) do better with good abstractions

Convex의 사례는 좋은 추상화가 개발자뿐 아니라 AI 에이전트도 복잡한 풀스택 앱을 더 안정적으로 만들게 한다는 점을 보여준다.

stack.convex.dev
#service-design#ai-architecture#agent-routing#context-compression
(LoRA) Fine-Tuning FLUX.1-dev on Consumer Hardware
Article2025년 6월 1일

(LoRA) Fine-Tuning FLUX.1-dev on Consumer Hardware

FLUX.1 dev의 트랜스포머를 4비트로 양자화하고 LoRA, 8비트 옵티마이저, 체크포인팅, 잠재 표현·텍스트 임베딩 캐시를 결합해 단일 GPU에서 약 10GB 미만의 VRAM으로 미세 조정하는 방법을 설명한다.

huggingface.co
#ai-architecture#agent-memory#capex-cycle#context-compression
Welcome Llama 4 Maverick & Scout on Hugging Face
Article2025년 5월 22일

Welcome Llama 4 Maverick & Scout on Hugging Face

Meta의 네이티브 멀티모달 MoE 모델 Llama 4 Maverick과 Scout가 출시 당일부터 Hugging Face Hub, Transformers, TGI, 양자화 및 Xet 저장소를 통해 제공되며, 최대 1천만 토큰 문맥과 강력한 추론·이미지·코딩 성능을 지원한다.

huggingface.co
#ai-architecture#multimodal#agent-deployment#agent-routing
The Transformers Library: standardizing model definitions
Article2025년 5월 15일

The Transformers Library: standardizing model definitions

트랜스포머스는 모델 정의를 표준화해 하나의 아키텍처 구현이 학습·추론·배포·로컬 실행 도구 전반으로 빠르게 이어지는 생태계의 중심축이 되고자 한다.

huggingface.co
#ai-architecture#llm#semiconductors#applications
LeRobot Community Datasets: The “ImageNet” of Robotics — When and How?
Article2025년 5월 11일

LeRobot Community Datasets: The “ImageNet” of Robotics — When and How?

로봇의 범용화는 모델 구조만의 문제가 아니라 다양한 환경·과제·기체에서 수집된 고품질 데이터를 함께 학습하는 문제이며, LeRobot 공동체는 개방형 로봇 데이터 생태계를 통해 로봇공학의 ‘이미지넷’을 만들어 가고 있다.

huggingface.co
#ai-architecture#multimodal#lerobot#llm
Falcon-Edge: A series of powerful, universal, fine-tunable 1.58bit language models.
Article2025년 5월 1일

Falcon-Edge: A series of powerful, universal, fine-tunable 1.58bit language models.

Falcon Edge는 하나의 사전학습 과정에서 범용 bfloat16 모델, 삼진 가중치 기반 BitNet 모델, 미세조정용 사전 양자화 모델을 함께 제공하는 1.58비트 언어 모델 시리즈다.

huggingface.co
#ai-architecture#multimodal#llm#vision-language-models
How to Build an MCP Server with Gradio
Article2025년 4월 30일

How to Build an MCP Server with Gradio

그라디오는 기존 파이썬 함수를 도구로 자동 변환하고 실행 옵션 하나로 웹 인터페이스와 모델 콘텍스트 프로토콜 서버를 함께 제공한다.

huggingface.co
#ai-architecture#agent-deployment#context-compression#prompt-library
Welcoming Llama Guard 4 on Hugging Face Hub
Article2025년 4월 29일

Welcoming Llama Guard 4 on Hugging Face Hub

메타가 공개한 라마 가드 4는 텍스트와 이미지를 함께 검사해 유해한 입력과 출력을 분류하는 120억 매개변수의 다국어 안전 모델이며, 프롬프트 주입과 탈옥을 탐지하는 라마 프롬프트 가드 2도 함께 제공된다.

huggingface.co
#privacy-design#ai-architecture#multimodal#agent-memory
Smol2Operator: Post-Training GUI Agents for Computer Use
Article2025년 4월 8일

Smol2Operator: Post-Training GUI Agents for Computer Use

Smol2Operator는 작은 비전 언어 모델에 GUI grounding과 행동 추론 능력을 단계적으로 학습시켜, 화면을 이해하고 클릭·입력·스크롤 같은 GUI 행동을 수행하는 에이전트로 발전시키는 공개 재현 가능한 학습 레시피입니다.

huggingface.co
#aguvis#smol2operator#hugging-face#xlangai-aguvis-stage1
🚀 Accelerating LLM Inference with TGI on Intel Gaudi
Article2025년 3월 29일

🚀 Accelerating LLM Inference with TGI on Intel Gaudi

Hugging Face는 Intel Gaudi 하드웨어 지원을 Text Generation Inference(TGI) 본체에 네이티브로 통합해, 별도 포크 없이 Gaudi 기반 LLM 추론 배포를 사용할 수 있게 했습니다.

huggingface.co
#ai-architecture#multimodal#llm#semiconductors
Mixture of Experts (MoEs) in Transformers
Article2025년 3월 27일

Mixture of Experts (MoEs) in Transformers

전문가 혼합 모델은 토큰마다 일부 전문가만 활성화해 전체 모델 용량과 실제 계산량을 분리하며, Transformers는 이를 효율적으로 지원하기 위해 가중치 로딩·실행 백엔드·전문가 병렬화 구조를 재설계했다.

huggingface.co
#kimi-k2-5#ai-architecture#transformer#agent-memory
Automating 90% of finance and legal work with agents
Article2025년 3월 25일

Automating 90% of finance and legal work with agents

Hebbia의 Matrix는 여러 OpenAI 모델과 에이전트를 병렬로 조율해 금융·법률 분야의 복잡한 문서 조사와 의사결정 업무를 대폭 자동화하려는 멀티에이전트 AI 플랫폼이다.

openai.com
#hebbia#matrix#openai#o3-mini
EliseAI improves housing and healthcare efficiency with AI
Article2025년 3월 18일

EliseAI improves housing and healthcare efficiency with AI

EliseAI는 주거·의료 현장의 기존 업무 방식을 대화형 AI로 자동화하고, 고객의 사업 성과와 이용자 경험을 함께 개선하는 데 집중한다.

openai.com
#service-design#ai-architecture#agent-routing#change-management
Factory builds the Command Center for software development with OpenAI’s reasoning models
Article2025년 3월 6일

Factory builds the Command Center for software development with OpenAI’s reasoning models

Factory는 OpenAI의 o1, o3‑mini, GPT‑4o를 개발 단계별로 배치해 코드 작성뿐 아니라 탐색·우선순위 결정·설계·실행까지 지원하는 통합 소프트웨어 개발 환경을 구축했다.

openai.com
#openai#privacy-design#ai-architecture#agent-deployment
Visualize and understand GPU memory in PyTorch
Article2025년 3월 1일

Visualize and understand GPU memory in PyTorch

PyTorch 메모리 스냅샷으로 GPU 사용량을 단계별로 시각화하고, 학습 과정의 최대 메모리를 구성 요소별로 추정하는 방법을 설명한다.

huggingface.co
#ai-architecture#agent-memory#capex-cycle#context-compression
Rogo scales AI-driven financial research with OpenAI o1
Article2025년 2월 13일

Rogo scales AI-driven financial research with OpenAI o1

기업용 금융 인공지능 플랫폼 로고는 오픈AI o1을 비롯한 모델과 대규모 금융 데이터를 결합해 문서 조사, 실사, 분석 자료 작성을 자동화하고 금융 전문가가 고부가가치 의사결정에 집중하도록 지원한다.

openai.com
#openai#ai-architecture#multimodal#llm
nanoVLM: The simplest repository to train your VLM in pure PyTorch
Article2025년 2월 6일

nanoVLM: The simplest repository to train your VLM in pure PyTorch

nanoVLM은 SigLIP 비전 인코더와 Llama 3 계열 언어 구조를 간결한 순수 PyTorch 코드로 연결해, 시각 질의응답용 VLM의 구성부터 학습·평가·추론까지 직접 익힐 수 있게 만든 경량 툴킷이다.

huggingface.co
#ai-architecture#multimodal#agent-routing#ai-infrastructure
Reinforcement Learning Heats Up, White House Orders Muscular AI Policy, and more...
Article2025년 1월 29일

Reinforcement Learning Heats Up, White House Orders Muscular AI Policy, and more...

DeepSeek R1의 공개는 중국 생성 AI의 추격, 오픈 웨이트 모델의 공급망 중요성, 기반 모델 가격 하락, 그리고 강화학습 기반 추론 모델·컴퓨터 사용 에이전트의 부상을 동시에 부각시켰다.

@DeepLearningAI
#anthropic#service-design#ai-architecture#multimodal
Introducing multi-backends (TRT-LLM, vLLM) support for Text Generation Inference
Article2025년 1월 16일

Introducing multi-backends (TRT-LLM, vLLM) support for Text Generation Inference

Hugging Face는 TGI를 단일 프런트엔드로 유지하면서 TensorRT LLM, vLLM, llama.cpp 등 다양한 추론 엔진을 백엔드로 연결할 수 있는 멀티 백엔드 아키텍처를 소개했다.

huggingface.co
#nvidia#ai-architecture#agent-deployment#ai-infrastructure
DeepSeek-V3 Redefines LLM Performance and Cost Efficiency
Article2025년 1월 15일

DeepSeek-V3 Redefines LLM Performance and Cost Efficiency

DeepSeek V3는 MoE 구조와 여러 학습 최적화를 바탕으로 주요 벤치마크에서 강한 성능을 보이면서도 매우 낮은 학습 비용을 제시해, 기초 모델 개발의 경제성을 다시 생각하게 만든다.

@DeepLearningAI
#deepseek#deepseek-r1#deepseek-v3#gpt-4o
이전1…181920212220 / 22다음