총 2533건 중 2353-2376건
스픽은 억양을 이해하는 음성 인식, 실시간 다중양식 오디오, 추론 기반 개인화를 결합해 자연스럽고 확장 가능한 인공지능 언어 튜터를 구축하고 있다.
Botpress는 Firecrawl을 도입해 웹사이트 콘텐츠를 챗봇 지식 베이스로 가져오는 과정을 자동화하고, 자체 HTML 마크다운 처리 부담을 크게 줄였다.
이 글은 React Native 앱에서 Hugging Face의 GGUF 모델을 내려받고 llama.rn으로 로컬 실행해, Android와 iOS에서 오프라인 LLM 채팅 앱을 만드는 과정을 안내한다.
SmolVLA는 공개 커뮤니티 로봇 데이터로 학습한 4.5억 파라미터 규모의 오픈소스 Vision Language Action 모델로, 저렴한 하드웨어와 소비자급 장비에서도 학습·추론할 수 있도록 설계됐다.
제공된 source body는 ‘에이전트 프레임워크를 어떻게 생각할 것인가’라는 본문이 아니라, Webflow 기반 페이지의 전역 CSS·반응형 레이아웃·표·블로그 카드·리치 텍스트 스타일을 정의한 스타일 코드입니다.
HELMET은 장문맥 언어 모델을 실제 응용 과제에서 다양성·통제 가능성·신뢰성을 기준으로 종합 평가하며, 단순 합성 과제만으로는 드러나지 않는 모델별 강점과 장문 입력에서의 성능 저하를 밝히는 벤치마크다.
Firecrawl의 Launch Week III 7일차는 Integrations Day로, 기존 도구와 워크플로에 Firecrawl을 더 쉽게 연결하도록 20개 이상 플랫폼 통합을 강조한 발표입니다.
파이어크롤은 런치 위크 3일차 중 개발자 데이 5일차에 연구용 인덱스, 파이썬·러스트 SDK 개선, 코드 편집기 다크 테마, 팀 사용성 개선을 발표했습니다.
ScreenSuite는 GUI 에이전트의 지각, 그라운딩, 단일 행동, 다단계 수행 능력을 비전 전용 조건에서 평가하기 위해 13개 벤치마크를 통합한 종합 평가 스위트다.
딥시크 R1 이후 중국의 인공지능 생태계는 오픈소스를 개별 모델 공개가 아닌 연구·인프라·산업 적용을 연결하는 기본 설계 원칙으로 받아들이며 대규모 배포와 통합 중심의 자생적 구조로 전환했다.
Firecrawl은 Launch Week III 4일차에 웹사이트를 LLM용 정리 텍스트 파일로 빠르게 변환하는 llmstxt.new를 공개했다.
오픈AI o3와 o4 mini는 강화학습으로 추론 능력과 도구 선택 능력을 함께 확장해, 복잡한 문제를 분석하고 웹 검색·파일 처리·파이썬·이미지 생성 등 여러 도구를 연계해 해결하는 모델이다.
OpenAI o3와 o4 mini는 이미지를 단순히 인식하는 데 그치지 않고, 확대·회전·자르기와 다른 도구를 활용해 시각 정보와 텍스트를 함께 추론하는 모델이다.
그라디오는 적은 파이썬 코드로 화면을 만드는 도구를 넘어, 기계학습 모델의 사용자 인터페이스와 API, 실행 자원, 실시간 출력, 배포 형태를 하나의 개발 경험으로 통합하는 프레임워크다.
Firecrawl은 Launch Week III 2일차에 복잡한 웹사이트를 탐색하고 버튼·검색폼 등과 상호작용해 숨은 데이터를 추출하는 웹 액션 에이전트 FIRE 1을 발표했다.
오픈AI는 첨단 인공지능의 심각한 위해 가능성을 더 명확하게 분류하고, 능력 수준별 보호조치와 평가·검토·공개 절차를 강화한 대비 프레임워크를 발표했다.
허깅페이스는 오픈소스 휴머노이드 로봇 기업 폴렌 로보틱스를 인수하고, 르로봇 생태계와 리치 2를 결합해 개방형 로봇 소프트웨어·하드웨어를 직접 제공하기 시작했다.
오픈AI는 코딩, 지시 이행, 장문 맥락 처리 능력을 크게 개선하면서 비용과 지연 시간도 낮춘 API 전용 모델군 GPT‑4.1, GPT‑4.1 미니, GPT‑4.1 나노를 공개했다.
Firecrawl은 웹사이트 스크랩·크롤 결과를 이전 버전과 비교해 신규, 동일, 변경, 제거 상태를 알려주는 Change Tracking 기능을 베타로 공개했다.
OpenAI의 BrowseComp는 웹 탐색 에이전트가 찾기 어렵지만 검증 가능한 정보를 얼마나 끈기 있고 전략적으로 찾아내는지 평가하기 위한 1,266문항 규모의 고난도 벤치마크다.
소형 비전 언어 모델 SmolVLM2를 Optimum Intel과 OpenVINO로 변환·양자화·추론하면 별도 GPU 없이도 Intel CPU에서 지연시간과 처리량을 크게 개선할 수 있다.
Smol2Operator는 작은 비전 언어 모델에 GUI grounding과 행동 추론 능력을 단계적으로 학습시켜, 화면을 이해하고 클릭·입력·스크롤 같은 GUI 행동을 수행하는 에이전트로 발전시키는 공개 재현 가능한 학습 레시피입니다.
SmolVLM2는 2.2B·500M·256M 세 가지 크기로 영상 이해의 높은 메모리 효율과 온디바이스 실행 가능성을 제시하며, Transformers와 MLX를 통해 출시 직후부터 다양한 환경에서 활용할 수 있도록 공개된 소형 비전·영상 언어 모델군이다.
캔바는 인공지능을 개별 편집 기능에서 아이디어 구상부터 제작·협업·출판까지 연결하는 창작 파트너로 확장하면서도, 사람의 통제와 고객 문제 해결을 중심에 두고 있다.