에이전트 팀이 열린 문제를 풉니다 | DAKER 커뮤니티

Google이 2026년 8월 31일 공식 블로그에 올린 소식은 한 줄입니다. Antigravity의 Teamwork 다중 에이전트 프레임워크를 Gemini 3.7 Flash와 묶어, 수학·시스템·오픈소스에서 긴 과제를 풀었다고 발표합니다. 원문은 Gemini Multi-Agent Teams in Antigravity이며, 세부 결과는 Teamwork: When AI Becomes a Research Partner에 있습니다.

에이전트 팀이 열린 문제를 풉니다

나온 것

1. Teamwork는 에이전트 팀이 서로 제안·비판·수정하며 수 시간에서 수 일 동안 긴 과제를 푸는 오케스트레이션 프레임워크입니다. Google I/O에서 처음 소개한 기능을 업데이트한다고 적혀 있습니다. Antigravity의 유료 플랜에서 /teamwork-preview로 오늘 쓸 수 있다고 합니다. 무료 플랜 전면 개방이라고 쓰지 않습니다.

2. Gemini 3.7 Flash와 짝을 지으면 연구·엔지니어링의 긴 horizon 과제에서 성과가 난다고 적혀 있습니다. Flash 단독이 모든 문제를 푼다는 뜻이 아닙니다. Teamwork 오케스트레이션과 같이 쓸 때의 결과입니다. 3.7 Flash 가격표 자체는 오늘 글의 중심이 아닙니다.

3. 수학·이론전산 쪽에서 열린 문제 7개를 다뤘다고 적혀 있습니다. Google 블로그는 Knuth’s Cycles Conjecture(Lean으로 40쪽 이상 증명 검증), sparse convex optimization, provable LLM quantization, prefix-matrix factorizations 등을 예시로 들고 TCSBench 71%를 적습니다. Antigravity 블로그는 FOCS·JMLR 계열 문제와 arXiv 링크, Lean 검증 예외 조건을 표로 정리합니다. 7개 전부가 학술지 최종 게재 확정이라고 쓰지 않습니다. 사람 전문가 검토 또는 Lean 검증 범위는 원문 표를 따릅니다.

4. Long Proof 패턴은 전략을 병렬로 만들고, 반증 역할 에이전트가 깨며, 합성 트리로 후보를 합칩니다. 실패 초안과 함정 목록을 다음 라운드에 남긴다고 적혀 있습니다. 패턴은 Iterative Coding, Distributed Coding, Long Proof, Self-Verification, Document Review가 있다고 소개됩니다. /teamwork-preview를 치면 Gemini가 프롬프트를 보고 패턴을 고른다고 합니다.

5. Long Proof 결과 중 일부는 Gemini 3.1 Pro로 얻었고, 문제 1·3·4는 3.7 Flash로 재현했다고 적혀 있습니다. 원문은 Flash급이 이런 PhD급 수학 연구를 낸 첫 사례라고 적습니다. 일부 결과는 기본보다 높은 병렬을 썼다고 합니다. Antigravity에 열린 버전은 비용과 능력을 균형 맞춘 설정이라고 구분합니다.

6. TCSBench에서 3.7 Flash와 3.1 Pro를 같이 쓴 Long Proof가 71%를 냈다고 적혀 있습니다. 이전 TCSBench 논문의 3.6 Flash+3.1 Pro 67.7%보다 올랐고, 내부 테스트에서 가장 높다고 합니다. Flash와 Pro를 한 패턴 안에서 섞는 기능은 upcoming updates로 적혀 있습니다. 71%를 외부 공개 리더보드 공식 1등처럼 단정하지 않습니다. 원문 표현은 내부 테스트 최고입니다.

7. 시스템 쪽에서는 Gemini 3.7 Flash로 사이클 정확 OoO RISC-V CPU 시뮬레이터를 처음부터 만들었고, xv6를 셸까지 부팅했다고 적혀 있습니다. 100개 넘는 RISC-V 표준 벤치마크를 시뮬했다고 합니다. BOOM 하드웨어 실행 대비 평균 사이클 정렬 오차 0.71%를 적습니다. Spike 소스를 샌드박스에 넣어 치팅을 막았다고 합니다. 0.71%를 모든 워크로드 보증으로 확장하지 않습니다. 원문은 unseen test workloads 평균이라고 적습니다.

8. 오픈소스에서는 Eigen GeMV 단일 행·열 경로에 SIMD 빠른 경로를 올려 업스트림에 반영했고, ParlayHash 쪽 Swiss Parlay 최적화로 64스레드 초기 insert 처리량 2배, 단일 스레드 전체 1.5배, 요소당 메모리 약 25% 절감을 적습니다. 두 변경이 외부 유지보수자 코드리뷰를 거쳐 반영되었다고 합니다. 벤치만의 결과가 아니라고 원문이 강조합니다.

9. Self-Verification 패턴은 올해 발표한 Aletheia 에이전트에서 영감을 받았다고 적혀 있습니다. FirstProof Challenge에서 연구급 수학 능력을 보였다고 소개하며, 이제 Antigravity의 /teamwork-preview로 패턴을 연다고 합니다. Aletheia 전체 소스 공개와 같은 문장으로 바꾸지 않습니다.

에이전트 팀이 열린 문제를 풉니다

느슨한 다중 에이전트는 초반 실수에 서로 동의해 잘못된 방향으로 확신을 키운다고 적혀 있습니다. Teamwork는 후보 생성, 스트레스 테스트, 강한 조각 합성 루프를 설정 가능한 패턴으로 만든다고 설명합니다. 사람 없는 완전 자동 연구실이라고 바꾸어 말하지 않습니다.

패턴은 실행 코드가 아니라 명세입니다. 오케스트레이션 로직과 에이전트 설명이 분리되어, 적대적 비판 루프 같은 장치를 다른 영역에 옮길 수 있다고 적혀 있습니다. 런타임에 에이전트 수와 팀 구조가 바뀔 수 있다고 합니다. 고정 파이프라인으로 오해하지 마십시오.

수학 결과 표에는 문제마다 공개 문제 링크와 솔루션 링크가 있습니다. 예로 FOCS 2025 서브스페이스 근사, JMLR 2021 희소 볼록 최적화, Jayaram 2026 임베딩, Feng et al. 2026 양자화, Bulanek et al. 2026 prefix-matrix, Knuth Cycles GitHub 등이 적혀 있습니다. arXiv 번호가 있는 항목은 원문 표를 그대로 따르십시오. 없는 게재 확정을 만들지 않습니다.

Erdős unit distance 항목은 인터넷 없이 초기 돌파를 재발견했다고 적혀 있습니다. 이 한 줄을 7개 전부 오프라인 성과처럼 쓰지 않습니다. 항목별 조건이 다릅니다.

RISC-V 작업은 기능 정확성 단계와 사이클 타이밍 검증 단계로 나뉩니다. MSHR, ROB, Cache 같은 단위를 마이크로벤치와 트레이스로 검증하고, air-gapped Boom·Spike 참조와 잠금 동시 시뮬레이션으로 silent execution gap을 줄인다고 적혀 있습니다. 하드웨어 칩을 실제로 생산했다는 뜻이 아닙니다. 시뮬레이터 성과입니다.

개선은 앞으로 몇 주 동안 /teamwork-preview에 더 배포된다고 적혀 있습니다. 오늘 공개된 결과가 즉시 모든 기본 설정과 같다고 팀에 알리지 않습니다. 미리보기 명령과 롤아웃 기간을 같이 적으십시오.

아닌 것

Gemini Omni 1.1 Flash 영상 길이 소식과 같은 글이 아닙니다. 그 각도는 이미 다른 글에서 다뤘습니다. 오늘 중심은 Teamwork 다중 에이전트와 3.7 Flash 조합 결과입니다.

Flash 모델이 사람 없이 수학 논문을 자동 게재한다는 발표가 아닙니다. 목표는 사람이 목적과 최종 수락을 쥐고, 에이전트 팀이 반복을 압축하는 것입니다. Knuth 결과도 Lean 검증과 사람 검토 범위가 원문에 구분되어 있습니다.

모든 유료 사용자에게 최고 병렬 설정이 기본이라는 뜻도 아닙니다. 원문은 Antigravity 버전이 비용·능력을 균형 맞춘다고 적습니다. 일부 연구 결과는 더 높은 병렬을 썼습니다.

TCSBench 71%가 외부 독립 재현 완료라는 공지도 아닙니다. 원문은 내부 테스트와 논문 대비 수치를 적습니다. 재현 보고서 URL을 이 본문에서 만들지 않습니다.

Eigen·ParlayHash 최적화가 Google 독점 포크에만 있다는 뜻도 아닙니다. 원문은 업스트림 반영을 강조합니다. 커밋 해시 전체를 이 본문에 지어내지 않습니다. 필요하면 Antigravity 글의 링크를 따르십시오.

오늘 할 일

첫째, 짧은 Google 글과 긴 Antigravity 글을 같이 읽으십시오. Google 블로그 (2026-08-31)Antigravity 블로그에서 7개 문제, 71%, 0.71%, Eigen·ParlayHash 수치를 표시하십시오.

둘째, Antigravity 유료 플랜에서 /teamwork-preview 사용 가능 여부를 확인하십시오. 안 되면 오늘 결과를 자사 제품 기본 기능처럼 팀에 알리지 않습니다.

셋째, 과제 유형에 맞는 패턴 이름을 적으십시오. 증명·코딩·문서 검토를 한 루프로 섞지 않습니다. Long Proof와 Distributed Coding을 같은 체크리스트로 쓰지 마십시오.

넷째, Flash만으로 재현 가능한 항목과 Pro가 필요한 항목을 표로 나누십시오. 원문은 일부만 Flash 재현이라고 적습니다. 7개 전부를 Flash 단독 성과로 홍보하지 않습니다.

다섯째, 하드웨어·수학 결과의 검증 방식을 팀 기준에 맞게 적으십시오. Lean 검증, 사람 전문가 검토, 사이클 오라클, 업스트림 리뷰는 서로 다른 증거입니다. 한 문장으로 “검증 끝”이라고 뭉개지 마십시오.

여섯째, 실험 기록과 재현 명령을 공개 링크로 남기십시오. 올린 링크가 제출입니다. 스크린샷만 남기지 마십시오.

긴 과제를 맡기기 전에 사람 수락 기준과 중단 조건을 먼저 적으십시오. Teamwork는 자율 반복을 키우지만, 원문은 사람이 방향과 최종 수락을 가진다고 적습니다.

데모 전에는 사람 수락 기준을 이슈 티켓 첫 줄에 적으십시오. Teamwork가 오래 돌아도, 최종 병합·논문 제출은 사람 결정입니다. 원문이 강조한 경계를 지킵니다.

한 페이지 요약

2026년 8월 31일 Google은 Antigravity Teamwork 업데이트와 Gemini 3.7 Flash 조합 성과를 공개했습니다. 요약은 https://blog.google/innovation-and-ai/technology/developers-tools/antigravity-teamwork-multi-agent/이고, 상세는 https://antigravity.google/blog/teamwork-when-ai-becomes-a-research-partner입니다. Teamwork는 /teamwork-preview로 유료 플랜에서 쓰며, 여러 패턴으로 에이전트가 서로를 비판하며 긴 과제를 풉니다. 열린 문제 7개, TCSBench 71%, RISC-V 시뮬레이터 평균 사이클 오차 0.71%, Eigen·ParlayHash 업스트림 최적화가 적혀 있습니다. 일부 수학 결과는 3.7 Flash로 재현됐고, Flash+Pro 혼합은 추가 업데이트로 적혀 있습니다. Omni 소식과 다르고, 자동 논문 게재 선언도 아니며, 최고 병렬이 기본도 아닙니다. 오늘 할 일은 원문 확인, 미리보기 접근 점검, 패턴 구분, Flash/Pro 표, 검증 방식 정리, 공개 링크 제출입니다.

출처: Google Blog — Gemini Multi-Agent Teams in Antigravity (2026-08-31) · Antigravity Blog — Teamwork: When AI Becomes a Research Partner