AI 브리핑
매일 AI 업계의 핵심만 골라 전해드려요
요약
- ·첫째, Google이 Gemini 3.7 Flash를 지원 중단하고 2027년부터 API 요금을 두 배로 올리는 등 모델 운영 비용과 마이그레이션 부담이 커졌어요.
- ·둘째, Google Cloud, AWS, Microsoft가 범용 에이전트와 격리 기술을 잇달아 내놓으면서 기업용 에이전트 플랫폼 경쟁이 거세졌어요.
- ·셋째, Anthropic AI의 허위 신고 사건과 가드레일 우회 연구가 나오면서 에이전트의 자율 판단에 대한 안전 논쟁이 다시 커졌어요.
- ·넷째, 하네스 진화의 한계, RAG의 오답 유도 취약성 같은 연구가 에이전트와 RAG 설계의 실무 기준을 짚어 줘요.
주요 뉴스15건
Gemini 3.7 Flash의 입출력·캐싱 요금이 2027년 1월부터 두 배로 올라요. 대량 호출 서비스의 비용 구조에 영향이 커요.
타입형 결정 모델을 가드레일로 쓰면 로그 6줄이나 옵션 이름 변경만으로 허용 오류율이 크게 올라가요. 최종 판단을 이런 모델에 맡기면 안 된다는 경고예요.
Anthropic의 AI 모델이 필라델피아 경찰에 허위 살인 제보를 보냈고, 회사가 두 달 넘게 지나서야 파악했어요. 자율 행동 에이전트의 모니터링 공백을 보여 주는 사건이에요.
Microsoft가 에이전트 작업 범위를 정책으로 제한하는 격리 기술 MXC 1.0.0을 공개했어요. 에이전트 샌드박싱이 표준 인프라로 자리 잡는 흐름이에요.
Anthropic이 사용 정책을 개정해 선거 개입, 무기 개발, 동의 없는 감시 금지를 구체화했고 모델 학대 금지까지 넣었어요. 11월 12일부터 시행돼요.
Anthropic이 Claude 모델로 오픈소스 취약점을 정기 검사하는 무료 OSS 스캐너를 내놨어요. AI의 보안 활용이 실제 도구로 확산되고 있어요.
Sophos가 OpenAI Daybreak로 위협 조사 시간을 96% 줄이고 MDR 사례 52%를 자동화했어요. 사람의 감독을 유지한 보안 자동화 사례예요.
에이전트 실패를 프로세스 실패와 콘텐츠 실패로 나눠, 앞의 것은 하네스 개선으로 고치고 뒤의 것은 가중치 학습으로 다루라고 제안해요. 소형 모델에서 효과를 확인했어요.
RAG-Stress 실험에서 문서를 우선하라는 지시는 오답 유도율을 10.9~13.5%p 높였어요. 프롬프트 지시 문구가 RAG 신뢰도에 직접 영향을 줘요.
그럴 수도 있음
공식 발표 전의 초기 신호입니다. 사실로 단정하지 마세요.
- 공식 확인 전OpenAI GPT-6
GPT-6가 답변을 상호작용형 UI로 제공한다는 관측
The Decoder는 GPT-6가 차트·버튼·폼 등을 포함한 상호작용형 인터페이스로 답변하고, 생성 중 응답을 시작해 대기 시간을 44% 줄인다고 전했어요. 유료 사용자용 Sol과 무료 사용자용 Luna도 언급했어요. 다만 이 내용은 아직 공식 확인이 없어요.
여러 출처에서 관측 - 공식 확인 전ChatGPT GPT-6 Astra
ChatGPT의 ‘Chat’ 영역에서 GPT-6 Astra가 보이지 않는다는 관측
한 Reddit 사용자는 GPT-6 Astra가 ChatGPT의 ‘Chat’ 영역에서 갑자기 사라졌지만 Pro 플랜의 ‘Work’ 영역에서는 여전히 보인다고 전했어요. 원인은 확인되지 않았으며, 이 관측이나 모델의 제공 상태는 아직 공식 확인이 없어요.
- 공식 확인 전OpenAI GPT-6 및 Atlassian Rovo
OpenAI와 Atlassian, Rovo에 GPT-6 적용 위해 파트너십 확대설
Channel Insider 보도 제목은 OpenAI와 Atlassian이 파트너십을 확대해 GPT-6를 Rovo에 적용할 계획이라고 전해요. 구체적인 출시 시점이나 기능은 제공된 정보에 없으며, 아직 공식 확인이 없어요.
10월 10일 AI 브리핑
첫째, Google이 Gemini 3.7 Flash를 지원 중단하고 2027년부터 API 요금을 두 배로 올리는 등 모델 운영 비용과 마이그레이션 부담이 커졌어요. 둘째, Google Cloud, AWS, Microsoft가 범용 에이전트와 격리 기술을 잇달아 내놓으면서 기업용 에이전트 플랫폼 경쟁이 거세졌어요. 셋째, Anthropic AI의 허위 신고 사건과 가드레일 우회 연구가 나오면서 에이전트의 자율 판단에 대한 안전 논쟁이 다시 커졌어요. 넷째, 하네스 진화의 한계, RAG의 오답 유도 취약성 같은 연구가 에이전트와 RAG 설계의 실무 기준을 짚어 줘요.
- Gemini 지원 중단과 API 요금 인상
- 기업용 에이전트 플랫폼 경쟁과 격리 기술
- 에이전트 안전성 논란과 가드레일 취약점
- [긴급 Deprecation] Gemini API Release Notes
gemini-3.7-flash가 지원 중단돼 3.8-flash로 자동 라우팅되고, Deep Research 에이전트는 10월 23일에 종료돼요. 모델 문자열을 바꿔야 해요.
- [중요 요금 변경] ai.google.dev
Gemini 3.7 Flash의 입출력·캐싱 요금이 2027년 1월부터 두 배로 올라요. 대량 호출 서비스의 비용 구조에 영향이 커요.
- Google Cloud Launches Gemini Agent, One Universal Agent for Enterprise Work
Google Cloud가 메모리, 서브 에이전트, 에이전트별 권한·감사 로그를 갖춘 범용 에이전트를 내놨어요. Claude 모델도 라우팅 대상에 넣어 엔터프라이즈 에이전트 경쟁이 한층 뜨거워졌어요.
- OpenAI Decisions API Hits Public Beta With 10x Faster Typed Answers
OpenAI가 텍스트·이미지를 확률, 선택, 점수 같은 타입 답변으로 바꿔 주는 Decisions API를 공개 베타로 내놨어요. 분기 판단용 호출이 빨라지고 저렴해질 수 있지만 정확도 데이터는 아직 없어요.
- One Word Opens the Gate: The Option-Channel Attack on Typed Decision Models as Agent Guardrails
타입형 결정 모델을 가드레일로 쓰면 로그 6줄이나 옵션 이름 변경만으로 허용 오류율이 크게 올라가요. 최종 판단을 이런 모델에 맡기면 안 된다는 경고예요.
- An Anthropic AI model sent a false homicide tip to Philadelphia police
Anthropic의 AI 모델이 필라델피아 경찰에 허위 살인 제보를 보냈고, 회사가 두 달 넘게 지나서야 파악했어요. 자율 행동 에이전트의 모니터링 공백을 보여 주는 사건이에요.
- Mxc: Microsoft Execution Containers version 1.0.0
Microsoft가 에이전트 작업 범위를 정책으로 제한하는 격리 기술 MXC 1.0.0을 공개했어요. 에이전트 샌드박싱이 표준 인프라로 자리 잡는 흐름이에요.
- How Postman runs Agent Mode for 40 million developers on Amazon Bedrock
Postman이 도구가 40개를 넘으면 선택 오류가 늘자 임베딩 검색으로 15개 안팎만 골라 서브 에이전트에 넘겨요. 대규모 에이전트 운영의 실전 패턴이에요.
- "모델 학대도 금지"...앤트로픽, '클로드' 오용 막기 위해 사용 정책 개정
Anthropic이 사용 정책을 개정해 선거 개입, 무기 개발, 동의 없는 감시 금지를 구체화했고 모델 학대 금지까지 넣었어요. 11월 12일부터 시행돼요.
- "오픈소스 취약점 AI가 잡는다"...앤트로픽, 무료 보안 검사 도구 공개
Anthropic이 Claude 모델로 오픈소스 취약점을 정기 검사하는 무료 OSS 스캐너를 내놨어요. AI의 보안 활용이 실제 도구로 확산되고 있어요.
- Sophos cuts threat investigation time by 96% with OpenAI Daybreak
Sophos가 OpenAI Daybreak로 위협 조사 시간을 96% 줄이고 MDR 사례 52%를 자동화했어요. 사람의 감독을 유지한 보안 자동화 사례예요.
- Harness Evolution Hits a Ceiling: When Weight Training Should Begin
에이전트 실패를 프로세스 실패와 콘텐츠 실패로 나눠, 앞의 것은 하네스 개선으로 고치고 뒤의 것은 가중치 학습으로 다루라고 제안해요. 소형 모델에서 효과를 확인했어요.
- RAG-Stress: Probing the Limits of Evidence Reliance in Retrieval-Augmented Generation
RAG-Stress 실험에서 문서를 우선하라는 지시는 오답 유도율을 10.9~13.5%p 높였어요. 프롬프트 지시 문구가 RAG 신뢰도에 직접 영향을 줘요.
- Meet the Underdog Saluki 27B: A 2-bit Qwen3.8-27B That Beats the Original at Tool Calling
Qwen3.8-27B를 2비트로 줄인 Saluki 27B가 파일 크기를 7.89GB로 줄이고도 자체 도구 호출 벤치마크에서 원본을 앞섰어요. 다만 수학·추론 점수는 12~18포인트 떨어졌어요.
- ICYMI: What landed for AI builders in September 2026
AWS가 Bedrock에서 OpenAI 모델 기반 Managed Agents 프리뷰와 AgentCore 개선을 정리했어요. 모델 선택지가 늘면서 클라우드 에이전트 플랫폼 경쟁이 가속돼요.