총 1678건 중 1585-1608건
올림픽코더 7B의 4비트 양자화 모델을 엘엠 스튜디오에서 구동하고 컨티뉴 확장 기능으로 비주얼 스튜디오 코드에 연결해 로컬 코딩 도우미로 사용하는 방법을 설명한다.
이 글은 Hugging Face의 huggingface hub에 포함된 MCP 클라이언트를 활용해 Python에서 약 70줄짜리 Tiny Agent를 실행하고 구성하며, LLM이 MCP 서버의 도구를 발견·호출·반영하는 흐름을 설명한다.
지난 1년간 비전 언어 모델은 다중 모달 입출력, 추론, 소형화, 전문가 혼합 구조, 로봇 행동 제어와 전통적 시각 작업의 통합을 중심으로 더 강력하고 효율적인 형태로 발전했다.
Hugging Face Open LLM Leaderboard의 평가 데이터를 통해 모델 추론 시 CO₂ 배출은 대체로 모델 크기와 함께 늘지만, 성능 향상은 그만큼 비례하지 않으며 커뮤니티 파인튜닝 모델이 더 효율적인 경우가 많다는 점을 분석했다.
오픈 비디오 생성 모델은 빠르게 발전하고 있지만 높은 메모리 요구량, 긴 생성 시간, 제한적인 일반화가 확산을 가로막고 있으며, 디퓨저스는 양자화·오프로딩·분할 추론을 조합해 이러한 모델을 더 적은 자원에서 실행할 수 있도록 지원한다.
이 글은 Convex에서 런타임 조건에 따라 인덱스, 정렬, 필터가 달라지는 동적 쿼리를 TypeScript 타입 검사를 유지한 채 구성하는 단계별 패턴을 설명한다.
Stack AI는 엔터프라이즈 AI 에이전트에 안정적이고 깨끗한 웹 데이터를 공급하기 위해 Firecrawl을 기존 데이터 수집 파이프라인에 15분 이내로 통합했다.
smolagents는 언어 모델이 외부 도구를 코드로 조합·실행하도록 지원해, 복잡한 다단계 에이전트 워크플로를 단순하게 구축하는 라이브러리다.
OpenAI는 인공지능 발전에 필요한 막대한 자본을 조달하면서 비영리 조직의 지속 가능성과 인류 전체에 이익이 되는 범용인공지능이라는 사명을 강화하기 위해, 영리 조직을 델라웨어 공익목적법인으로 전환하는 방안을 검토하고 있다.
이 글은 언어 모델의 다음 토큰 선택 과정에서 로짓을 직접 조정해 길이, 문맥 유지, 필수 문구, 선택형 답변 같은 생성 제약을 제어하는 방법을 NVIDIA의 LogitsProcessorZoo와 Hugging Face 생성 API 예시로 설명한다.
KVPress는 긴 문맥에서 선형으로 증가하는 키·값 캐시를 중요도 기반으로 압축해 메모리 사용량을 줄이고 생성 속도를 높이는 모듈형 도구다.
빅 벤치 오디오 평가 결과, 음성을 직접 처리하는 모델은 텍스트 기반 추론보다 정확도가 크게 낮았으며 추론이 중요한 환경에서는 음성 인식·텍스트 추론·음성 합성을 연결한 파이프라인이 더 우수했다.
OpenAI는 o series 모델에 사람이 쓴 안전 명세를 직접 가르치고 추론 과정에서 이를 검토하게 하는 ‘숙고적 정렬’을 통해 악성 요청 거부와 benign 요청 허용의 균형을 개선했다고 설명한다.
단순한 <textarea 로는 동시 편집이 충돌하므로, Convex와 ProseMirror 기반 동기화 컴포넌트, Tiptap 또는 BlockNote를 조합해 기존 앱에 협업 문서 편집기를 붙이는 절차를 설명한다.
OpenAI는 향상된 추론 모델 o1, WebRTC 기반 Realtime API, 저비용 음성 모델, 선호도 미세조정과 개발자용 SDK를 공개하며 성능·유연성·비용 효율을 강화했다.
팰컨3는 10억~100억 매개변수 규모에서 과학·수학·코딩·추론 성능과 학습 효율을 함께 높이고, 다양한 배포 형식과 개방형 라이선스를 제공하는 디코더 전용 언어 모델 제품군이다.
오픈AI는 일론 머스크가 영리 구조 자체에 반대했던 것이 아니라 2017년 영리 전환을 추진하면서 지분 과반, 절대적 통제권, 최고경영자 지위를 요구했고, 그 조건이 받아들여지지 않자 회사를 떠났다고 주장한다.
Models mentioned in this article 1 More Articles from our Blog aws partnerships How to deploy and fine tune DeepSeek models on AWS 56 January 30, 2025…
OpenAI는 2024년 12월 Sora Turbo를 독립형 영상 생성 서비스로 출시하며 창작 기능과 요금제, 모델의 한계, 출처 표시 및 악용 방지 대책을 함께 공개했지만, 해당 Sora 제품은 2026년 4월 26일부로 제공이 종료됐다.
Sora는 텍스트·이미지·영상을 입력받아 최대 1080p·20초 영상을 생성하거나 편집하는 모델이며, OpenAI는 데이터 필터링, 외부 레드팀, 내부 평가, 입출력 분류기와 제품 제한을 결합해 오용 위험을 줄이고자 했다.
Cargo는 Firecrawl의 안정적인 웹페이지 스크래핑과 구조화 출력으로 GTM 팀의 산업 분류, 메시지 개인화, 데이터 보강 워크플로를 자동화한다.
Diffusers와 PEFT의 LoRA 핫스와핑, torch.compile, FP8 양자화, Flash Attention 3를 조합해 Flux.1 Dev의 재컴파일 문제를 피하고 고성능 GPU에서 약 2.23배, RTX 4090에서 약 2.04배 빠른 LoRA 추론을 구현한 최적화 방법을 설명한다.
간단한 일정 관리 대화 실험에서 대규모 언어 모델의 실수 수정 능력을 비교한 결과, 최신 3B~9B급 모델은 대체로 피드백을 반영했지만 소형·구형 모델은 형식 준수와 문맥 유지에서 반복적으로 실패했으며 모델 크기만으로 성능이 보장되지는 않았다.
OpenAI o1 계열은 강화학습 기반의 숙고형 추론으로 안전 정책 준수와 탈옥 공격 저항성을 높였지만, 향상된 지능이 새로운 위험을 만들 수 있어 지속적인 정렬·스트레스 테스트·위험 관리가 필요하다.