코멘토 로고

AI 브리핑

기업과 기술의 중요한 변화를 계속 쌓아드려요

기술·시장 테마

오픈소스 AI

2026.09.11 업데이트 · 사건 24

지금의 흐름

Cohere Releases North Small Translate: A 218B MoE Translation Model That Scores 83.6 on WMT26 Across 50 Languages 등 최근 공개 사건을 중심으로 관련 변화가 이어지고 있어요.

핵심 변화

  1. 1Cohere가 218B 파라미터 규모(25B 활성)의 오픈 웨이트 MoE 번역 모델 North Small Translate를 공개했어요. 50개 언어를 지원하며 자체 WMT26 평가에서 83.6점(에이전틱 모드 84.36점)을 기록했고, DeepL·Google Translate·GLM
  2. 2Cohere의 공식 변경이라 관련 제품과 개발 전략에 직접 영향을 줄 수 있어요.
  3. 3Cohere Releases North Small Translate: A 218B MoE Translation Model That Scores 83.6 on WMT26 Across 50 Languages

변화 타임라인

  1. Cohere Releases North Small Translate: A 218B MoE Translation Model That Scores 83.6 on WMT26 Across 50 Languages

    Cohere가 218B 파라미터 규모(25B 활성)의 오픈 웨이트 MoE 번역 모델 North Small Translate를 공개했어요. 50개 언어를 지원하며 자체 WMT26 평가에서 83.6점(에이전틱 모드 84.36점)을 기록했고, DeepL·Google Translate·GLM 5.2 등을 앞선다고 밝혔어요. Cohere API에서 무료로 호출하거나 BF16/FP8/NVFP4 체크포인트로 자체 호스팅, 상업 라이선스 이용이 가능해요.

    왜 중요한가요? Cohere의 공식 변경이라 관련 제품과 개발 전략에 직접 영향을 줄 수 있어요.

  2. [중요 Deprecation] docs.cohere.com

    Cohere 공식 문서(docs.cohere.com)의 Parse 관련 페이지에 deprecation 항목이 반영됐어요. 문서 목차에 'North Small Translate' 등 모델 항목이 추가되는 등 문서 구조 변경이 확인됐고, 관련 API/SDK 의존성에 대한 마이그레이션 검토가 권고돼요.

    왜 중요한가요? Cohere의 공식 변경이라 관련 제품과 개발 전략에 직접 영향을 줄 수 있어요.

  3. DeepSeek AI Released DeepSeek-V4.1-Flash with 1M Context, FP4 KV Cache, and Cross-Layer Attention Reuse

    DeepSeek AI가 100만 토큰 컨텍스트를 지원하는 멀티모달 MoE 모델 DeepSeek-V4.1-Flash를 공개했어요. FP4 KV 캐시 양자화, 인코더-디코더 분리 구조, 계층 간 어텐션 재사용(CSA2) 등을 통해 토큰당 KV 캐시 용량을 이전 모델의 약 4분의 1로 줄였어요. MIT 라이선스로 공개됐고 Terminal-Bench 2.1, DeepSWE v1.1 등 벤치마크에서 Opus-5, GPT-5.6 Sol을 능가하는 결과를 보였어요.

    왜 중요한가요? Open Source Ai의 공식 변경이라 관련 제품과 개발 전략에 직접 영향을 줄 수 있어요.

  4. Hugging Face Transformers v5.17.0 출시, HYV4·VibeVoice·NeoMME-Retriever 등 신규 모델 대거 추가

    transformers 라이브러리 v5.17.0이 공개되어 780B 파라미터 MoE 언어모델 HYV4, 장문 다중화자 음성합성 VibeVoice, 문서 검색용 멀티모달 인코더 NeoMME/NeoMME-Retriever, 경량 ASR 모델 Fun-ASR-Nano 등 다수 신규 모델이 추가됐다. Vision 2D/3D 로터리 임베딩이 통합 RoPE 모듈로 표준화되고, 생성 단계 동기화 오버헤드 감소·원격 허브 파일 무조건 다운로드 방지·캐시 버그 수정 등의 개선이 포함됐다.

    왜 중요한가요? 오픈소스 AI 생태계의 핵심 라이브러리에 대형 MoE 모델과 시각 문서 검색용 임베딩 모델이 공식 통합되면서, 개발자들이 최신 아키텍처와 RAG용 검색 모델을 즉시 활용할 수 있게 됐다.

  5. OpenBMB Releases MiniCPM5-2B: A 2.52B Dense Model Averaging 53.9 Across 34 Benchmarks and Built to Run On Device

    OpenBMB가 온디바이스 구동을 목표로 25억 파라미터급 밀집 언어모델 MiniCPM5-2B를 공개했어요. 131,072 토큰 컨텍스트를 지원하며 34개 벤치마크 평균 53.9점으로 더 큰 Qwen3.5-4B(51.1점)를 앞섰고, 특히 툴 사용과 코딩 에이전트, 장문 검색 영역에서 강점을 보였어요. Apache 2.0 라이선스로 가중치와 함께 사전학습·SFT·RL 데이터셋 및 중간 체크포인트도 함께 공개됐어요.

    왜 중요한가요? Open Source Ai의 공식 변경이라 관련 제품과 개발 전략에 직접 영향을 줄 수 있어요.

  6. Mistral AI, 오픈웨이트·주권형 AI 개발 위해 30억 유로 투자 유치

    프랑스 AI 기업 Mistral AI가 오픈웨이트 및 주권형 AI를 프런티어 기술 수준으로 발전시키기 위해 30억 유로 규모의 투자를 유치했다.

    왜 중요한가요? 유럽 중심의 독립적인 오픈웨이트 AI 생태계 구축 노력을 뒷받침하는 대규모 자금 조달로, 오픈소스 AI 경쟁 구도에 영향을 줄 수 있다.

  7. H Company Releases NeoMME: A Family of 260M and 800M Single-Tower Multimodal Encoders That Drop the Vision Tower and Causal Decoder

    H Company가 비전 타워와 인과 디코더를 제거한 단일 트랜스포머 구조의 멀티모달 인코더 NeoMME(260M, 800M)를 공개했어요. 텍스트 토큰과 32×32 이미지 패치를 같은 레이어에서 처리하며, 마스크드 디퓨전 방식으로 사전학습되어 ViDoRe v3에서 260M 모델이 0.523 nDCG@10을 기록해 3.75B 규모의 ColQwen2.5와 비슷한 성능을 냈어요. 모든 체크포인트는 Apache 2.0 라이선스로 Hugging Face Transformers에서 즉시 사용 가능하고, 토큰 풀링과 양자화로 인덱스 크기를 페이지당 최대 255배까지 줄일 수 있어요.

    왜 중요한가요? Huggingface의 공식 변경이라 관련 제품과 개발 전략에 직접 영향을 줄 수 있어요.

  8. UC Berkeley Researchers Release CUA-Lite, an Open Platform Unifying Sandboxes, Data, Evaluation and RL for Computer-Use Agents

    UC 버클리 연구팀이 컴퓨터 사용 에이전트(CUA)를 위한 오픈 플랫폼 CUA-Lite를 공개했어요. Lite.OSWorld는 기존 QEMU/KVM 가상머신 대신 Docker 컨테이너에서 OSWorld 벤치마크를 실행해 메모리 사용량을 4.1GB에서 0.9GB로 줄이고 약 4.6배 더 많은 병렬 인스턴스를 지원하며, 13개 모델에서 VM과 동일한 점수를 재현했어요. 통합 데이터 스키마 LiteSample, 10개 이상의 에이전트, 15개 이상의 벤치마크, 3만 개 이상의 검증 가능한 태스크를 포함하며 데이터셋은 Hugging Face에 공개됐어요.

    왜 중요한가요? Huggingface의 공식 변경이라 관련 제품과 개발 전략에 직접 영향을 줄 수 있어요.

  9. 허깅페이스가 주목한 韓 '비드래프트'…글로벌 AI 무대서 기술력 입증

    글로벌 AI 플랫폼 허깅페이스가 매주 선정하는 'Space of the Week'에 국내 스타트업 비드래프트가 공개한 프로젝트 'ai-world'가 선정됐어요. 빅테크가 아닌 국내 스타트업이 자체 기술력으로 글로벌 AI 개발자 생태계의 주목을 받은 사례로 소개됐어요.

    왜 중요한가요? Huggingface의 공식 변경이라 관련 제품과 개발 전략에 직접 영향을 줄 수 있어요.

  10. IFM, K2 Horizon 6종 오픈소스 모델 공개(0.9B~375B, Apache 2.0)

    MBZUAI 산하 IFM이 0.9B부터 375B-A23B까지 6개 모델로 구성된 K2 Horizon을 Apache 2.0으로 공개하고 사전학습 코퍼스, 중간 체크포인트, 학습 코드까지 함께 배포했다. vLLM, SGLang, Ollama에서 즉시 사용 가능하며 MoVA 어텐션 라우팅과 3배 디코딩 속도의 Uno LoRA 어댑터도 함께 제공됐다.

    왜 중요한가요? 모델 가중치뿐 아니라 학습 데이터, 코드, 체크포인트까지 전면 공개해 오픈소스 AI 생태계의 투명성과 재현성을 크게 높인 사례로, 기업들이 다양한 크기의 모델을 동일한 아키텍처로 프로토타입부터 대규모 배포까지 확장할 수 있게 한다.

  11. 엔비디아, 허깅페이스 17.5조원에 인수 발표

    엔비디아가 오픈소스 AI 플랫폼 허깅페이스를 129억3030만달러(약 17조5600억원)에 인수하기로 공식 합의했다. 투자자에게 119억달러 지급, 합류 직원에게 최대 10억달러 규모 주식 보상을 제공하며, 내년까지 인수를 마무리하고 개방형 플랫폼 운영 방식을 유지할 계획이다.

    왜 중요한가요? 엔비디아 사상 최대 규모 인수합병으로, GPU·데이터센터 중심 사업에서 모델·데이터셋·개발자 도구까지 AI 생태계 전반으로 영향력을 확대하며 오픈소스 AI 생태계의 주도권 구도를 바꾼다.

  12. GLM-5.3-Flash vs Qwen3.8-Flash-Next: Two Chinese AI Labs Independently Converge on the Same Model Architecture

    Z.ai가 320B 파라미터의 멀티모달 MoE 모델 GLM-5.3-Flash를, 알리바바 Qwen팀이 125B 파라미터의 Qwen3.8-Flash-Next를 하루 간격으로 공개했어요. 두 모델은 서로 독립적으로 개발됐지만 선형·전체 어텐션을 3:1로 혼합하고, 압축 인덱서로 2048토큰만 선택하며, 잔차 스트림을 4개 분기로 확장하고 Muon 옵티마이저로 학습하는 등 거의 동일한 아키텍처 설계에 도달했어요. GLM-5.3-Flash는 1M 토큰 컨텍스트와 저가 정책을 앞세우고, Qwen3.8-Flash-Next는 Qwen4 아키텍처를 미리 보여주는 프리뷰 모델로 소개됐어요.

    왜 중요한가요? Open Source Ai의 공식 변경이라 관련 제품과 개발 전략에 직접 영향을 줄 수 있어요.

  13. 코히어, 23억 파라미터 문서 AI 모델 '파스 5' 공개

    코히어가 PDF·슬라이드·이미지 등 문서를 텍스트로 변환하는 23억 파라미터 비전언어모델 '파스 5'를 공개했다. OCR과 내용 이해를 통합 처리해 표·이미지·위치 정보를 함께 파악하며 9개 언어를 지원한다. API 가격은 1000페이지당 1.5달러이며, GPU 한 장당 초당 4.5페이지, H100 8장 서버 기준 초당 약 36페이지를 처리한다.

    왜 중요한가요? 벤치마크 최상위는 아니지만 가격 대비 성능과 처리 속도를 앞세워 대규모 문서 처리·RAG 파이프라인의 비용을 크게 줄일 수 있는 실용적 대안을 제시한다.

  14. 엔비디아, 오픈소스 AI 플랫폼 허깅페이스 129억달러에 인수

    엔비디아가 세계 최대 오픈소스 AI 모델 플랫폼 허깅페이스를 129억달러(약 18조원)에 인수하기로 합의했다.

    왜 중요한가요? 하드웨어 중심 엔비디아가 AI 모델·개발자 플랫폼까지 확보해 GPU 중심 AI 컴퓨팅 생태계를 수직통합하려는 전략으로, 오픈소스 AI 생태계에 큰 영향을 미친다.

  15. Cohere, 문서 파싱 전용 비전언어모델 'Parse'(parse-v5.0) 출시

    Cohere가 23억 파라미터 비전언어모델 Parse를 공개했다. PDF·PPT·JPEG 페이지를 별도 OCR 없이 마크다운, HTML 테이블, 바운딩박스, 이미지 설명 등으로 변환하며 API 가격은 1,000페이지당 1.50달러, Model Vault 전용 인스턴스로도 제공된다.

    왜 중요한가요? RAG 파이프라인의 문서 수집·구조화 단계를 자동화해 기업의 문서 기반 검색·근거화 비용과 시간을 줄일 수 있다.

  16. Alibaba Qwen, 2.4T 파라미터 오픈 웨이트 모델 Qwen3.8-2.4T-A95B 공개

    Alibaba Qwen팀이 Qwen-Max급 최초 오픈 웨이트 모델인 Qwen3.8-2.4T-A95B(총 2.4조 파라미터, 토큰당 950억 활성화)를 공개했으며, 하이브리드 선형+전체 어텐션 구조, 최대 262K(확장 시 1M) 토큰 컨텍스트, 네이티브 멀티토큰 예측 기반 추론 가속을 지원한다. AWS는 이를 SageMaker HyperPod와 vLLM으로 8×NVIDIA B300 GPU 노드에 NVFP4 양자화(약 1.2TB)로 서빙하는 방법을 공개했다.

    왜 중요한가요? 최상위급 성능의 초대형 모델을 오픈 웨이트로 공개함으로써 기업이 자체 인프라에서 데이터 통제권을 유지하며 에이전트형 코딩·툴 사용·장기 추론 작업에 활용할 수 있게 되어, 오픈소스 AI 생태계와 대규모 모델 서빙 방식에 실질적 변화를 가져온다.

  17. mem0 TypeScript SDK v3.1.6, Oracle AI Vector Search 벡터 스토어 지원 추가

    mem0ai/mem0 TS SDK v3.1.6에서 Oracle AI Vector Search 벡터 스토어를 신규 지원(풀링 연결, HNSW/IVF 인덱스, JSON 페이로드 필터링, 6종 거리 메트릭)하고, 세션 스코프 키 특수문자 처리 버그와 Oracle 초기화 실패 시 커넥션 풀 정리 버그를 수정했다. insert 배치 유효성 검증을 추가하고 Oracle 벡터 스토어의 insert/list/search 성능을 개선했으며, 8개 high·18개 medium 심각도 의존성 취약점을 패치했다.

    왜 중요한가요? RAG용 벡터 스토어 선택지가 확대되고 성능·보안이 개선되어 mem0 기반 메모리/검색 시스템의 안정성과 확장성이 높아진다.

  18. vLLM v0.27.0 출시, Kimi K3·Qwen3.5 지원 및 PyTorch 2.13 업그레이드

    vLLM v0.27.0이 561개 커밋과 242명 기여자 참여로 출시되어 Kimi K3, Qwen3.5, VaultGemma 등 신규 모델 지원과 PyTorch 2.13/Triton 3.7.1 업그레이드, FlashAttention 4 SM100 최적화, DeepSeek-V4 성능 개선, Model Runner V2 확장, Rust 프론트엔드 gRPC 제어 플레인 추가 등이 반영됐습니다.

    왜 중요한가요? 주요 오픈소스 추론 서빙 엔진의 대규모 업데이트로 신규 모델 지원과 하드웨어 성능 최적화가 결합되어 실제 프로덕션 배포 성능과 비용에 직접적 영향을 미칩니다.

  19. NVIDIA, 물리 AI용 오픈 월드 모델 'Cosmos 3' 발표

    NVIDIA가 비전-언어 모델, 물리 기반 월드 시뮬레이터, 월드 액션 모델의 백본으로 쓸 수 있는 믹스처-오브-트랜스포머 구조의 'Cosmos 3'를 Super(64B), Nano(16B), Edge(4B) 세 가지 크기로 OpenMDW 1.1 라이선스 하에 공개했다. Omniverse·OpenUSD와 결합해 로봇, 자율주행차, 비전 AI 시스템을 위한 시뮬레이션 및 합성 데이터 생성 워크플로우를 지원한다.

    왜 중요한가요? 물리 AI 개발에 필요한 대규모·다양한 학습 데이터 확보와 시뮬레이션 검증을 오픈 모델로 지원함으로써 로보틱스·자율주행 분야의 개발 장벽을 낮춘다.

  20. Qdrant v1.19.0 출시, TurboQuant 4비트 및 메모리 계층 통합 설정 추가

    Qdrant가 v1.19.0을 릴리스했다. TurboQuant 4비트 벡터 저장 데이터타입, 컬렉션별 메모리 계층(cold/cached/pinned) 통합 설정, 키워드 prefix 매칭 필터, 쿼리별 IDF 계산, 슬라이스 필터링, 전역 쿼터 API, 결정적 읽기 라우팅 토큰 등이 추가되었고 다수의 성능 개선 및 버그 수정이 포함됐다.

    왜 중요한가요? 벡터DB의 저장 효율과 검색 기능이 개선되면서 RAG 시스템의 비용과 정확도, 운영 유연성에 직접적인 영향을 준다.

  21. NVIDIA, 자율주행용 오픈 모델 'Alpamayo 2 Super' 상용 라이선스로 공개

    NVIDIA가 로보택시·자율주행차용 340억 파라미터 비전-언어-액션 모델 Alpamayo 2 Super를 Hugging Face에 공개했다. 32B VLM과 2.3B 디퓨전 액션 디코더로 구성되며 OpenMDW-1.1 라이선스로 파인튜닝, 파생 모델, 상업적 재배포가 가능하다. Alpamayo 전체 모델군에도 동일 라이선스가 적용돼 기존 R&D용 모델도 즉시 상업 배포가 가능해졌다.

    왜 중요한가요? 자동차 제조사와 공급사가 자체 데이터로 커스터마이징한 자율주행 모델을 별도 허가 없이 상업적으로 배포할 수 있게 되어, 자율주행 개발의 진입장벽과 비용을 낮추고 오픈소스 AV 생태계 경쟁을 촉진한다.

  22. 마이크로소프트 리서치, 에이전트 AI 학습용 오픈소스 프레임워크 'Orchard' 공개

    마이크로소프트 리서치가 소프트웨어 엔지니어링, 웹 내비게이션, 개인 어시스턴트 등 다양한 도메인의 에이전트를 훈련·평가할 수 있는 쿠버네티스 기반 오픈소스 프레임워크 Orchard와 핵심 구성요소 Orchard Env를 공개했으며, 훈련 데이터와 평가 방법도 함께 배포했다. 약 30억 파라미터의 작은 모델로 SWE-bench Verified 69.7%(리랭킹 시 73.0%) 성능을 달성했다.

    왜 중요한가요? 기존에는 폐쇄형 인프라와 데이터셋이 필요했던 에이전트 AI 연구를 오픈소스로 재현 가능하게 만들어, 연구자와 개발자가 더 적은 자원으로도 강력한 에이전트를 구축·검증할 수 있게 된다.

  23. Liquid AI Releases LFM2.5-Encoder-230M and LFM2.5-Encoder-350M: Bidirectional Encoders That Stay Fast at 8K Context on CPU

    Liquid AI가 8,192 토큰 컨텍스트를 지원하는 경량 양방향 인코더 두 가지를 출시했어요. LFM2.5-Encoder-230M과 LFM2.5-Encoder-350M은 LFM2 하이브리드 아키텍처 기반으로 만들어져 CPU에서도 빠르게 작동해요. 이 모델들은 엣지 디바이스, 규제가 많은 금융·의료·법률 시스템, 고비용 효율이 필요한 파이프라인에서 분류, 라우팅, 안전 필터링 등에 활용될 수 있어요.

    왜 중요한가요? Open Source Ai의 공식 변경이라 관련 제품과 개발 전략에 직접 영향을 줄 수 있어요.

  24. MCP Python SDK v2.0.0 정식 출시, 2026-07-28 프로토콜 지원

    Model Context Protocol Python SDK의 안정 버전 v2.0.0이 출시되어 2026-07-28 프로토콜 리비전을 지원하며 이전 버전과 하위 호환성을 유지한다. FastMCP가 MCPServer로 통합되고 첫 번째 클래스 Client 객체가 제공되며, 멀티라운드 트립 요청, OpenTelemetry 트레이싱 기본 지원, 별도의 mcp-types 패키지, 강화된 stdio·OAuth 보안이 추가됐다. v1.x는 유지보수 모드로 전환된다.

    왜 중요한가요? MCP는 AI 에이전트와 도구 연동의 핵심 표준 프로토콜로, 주요 SDK의 메이저 업그레이드는 다수의 에이전트 프레임워크와 서버 개발에 직접 영향을 미친다.

관련 테마