challengekim

· 12건

10월 7일 (수)

아침판

08:00

오늘의 흐름

구글 딥마인드가 여러 형태의 자료를 함께 검색할 수 있는 임베딩 모델을 공개했고, 미스트랄은 1조 파라미터 모델의 공개 프리뷰를 시작했습니다. 클라우드 에이전트가 로컬 파일을 다루는 기능도 배포되기 시작했습니다.

모델·제품3

  1. 구글 딥마인드, 멀티모달 임베딩 모델 EmbeddingGemma 2 공개

    구글 딥마인드가 텍스트·코드·이미지·영상·음성을 같은 768차원 공간에 넣는 EmbeddingGemma 2를 Apache 2.0으로 공개했습니다.

    270M 본체에 비전·오디오 인코더를 선택적으로 붙이는 구조입니다. 스마트폰에서 오프라인으로 실행할 수 있다고 합니다.

    왜 중요한가

    문서와 이미지, 음성 등을 함께 찾는 검색 기능을 로컬에서 구축하려는 개발자에게 선택지가 생겼습니다.

    10/7 · CHOI Threads

  2. 미스트랄, 1조 파라미터 Mistral Large 4 공개 프리뷰 시작

    미스트랄이 1조 파라미터 MoE 모델 Mistral Large 4를 공개 프리뷰로 내놨습니다. 한 번에 활성화되는 파라미터는 490억 개이고 컨텍스트 길이는 512K입니다.

    API는 바로 사용할 수 있으며, 가중치는 10월 말 공개될 예정입니다. 후보 요약에 따르면 Artificial Analysis 종합 지수는 직전 Medium 3.5의 14점에서 38점으로 올랐습니다.

    왜 중요한가

    긴 자료와 에이전트 작업에 쓸 모델을 비교하는 팀이라면 API를 먼저 시험해 볼 수 있습니다.

    10/7 · CHOI Threads

  3. 구글, 이미지 생성·편집 모델 나노 바나나 2.1 공개

    구글이 나노 바나나 2.1을 공개했습니다. 후보 요약에 따르면 1K 이미지 한 장의 가격은 0.0336달러로 Pro의 4분의 1이며, 마스크 기반 편집과 피사체 일관성이 개선됐습니다.

    Gemini 앱과 AI Studio 등에 배포되며, API에서는 gemini-nano-banana-2.1로 호출합니다. 추론 기본값은 medium입니다.

    왜 중요한가

    이미지를 반복 생성하거나 수정하는 팀은 기존 모델과 비용·결과물을 비교할 수 있습니다.

    10/7 · CHOI Threads

에이전트·개발 실무2

  1. Claude 클라우드 에이전트, 허용된 로컬 폴더에서 파일 작업 시작

    앤트로픽이 Claude Projects의 클라우드 세션에 사용자가 허용한 로컬 폴더를 연결하는 기능을 배포하기 시작했습니다. 에이전트는 필요할 때 해당 파일을 읽고 수정할 수 있습니다.

    노트북을 닫은 뒤에도 클라우드에서 작업이 이어지고, 휴대폰으로 지시할 수 있습니다. 로컬 브라우저 제어도 가능하다고 합니다.

    왜 중요한가

    컴퓨터 앞에 있지 않을 때도 로컬 자료를 쓰는 작업을 에이전트에 맡기려는 사람에게 유용합니다.

    10/7 · CHOI Threads

  2. HyperFrames, 사람과 에이전트가 같은 타임라인에서 편집하는 Studio 공개

    HyperFrames Studio에서는 글로 요청해 영상 초안을 만든 뒤 사람이 같은 타임라인에서 수정할 수 있습니다. 프레임에 표시와 메모를 남겨 에이전트에 해당 부분의 수정을 요청할 수도 있습니다.

    글꼴·색상·이미지는 사람이 직접 바꿀 수 있습니다.

    왜 중요한가

    에이전트가 만든 영상의 일부만 고쳐야 하는 제작자에게 편집 방식의 선택지가 됩니다.

    10/7 · CHOI Threads

AI 안전·사고1

  1. 오픈AI, 에이전트 작업을 검토하는 Auto-review 무료 공개

    오픈AI가 별도 에이전트로 작업 과정을 검토해 위험하거나 원래 요청에서 벗어난 행동을 차단하는 Auto-review를 무료로 공개했습니다.

    후보 요약에 따르면 ChatGPT 계정으로 로그인한 사용자는 무료로 이용할 수 있고, 검토 에이전트의 사용량은 한도에서 차감되지 않습니다.

    왜 중요한가

    오래 걸리는 작업을 에이전트에 맡기는 사람은 중간 검토에 드는 비용과 승인 부담을 줄일 수 있습니다.

    10/7 · CHOI Threads

뜨는 오픈소스1

  1. 게임 제작 에이전트 앱 Genex, 플레이테스트 결과를 작업에 반영

    MIT 오픈소스 앱 Genex는 여러 에이전트가 역할을 나눠 Three.js·Blender·Meshy·Tripo·ElevenLabs 등을 연결하고 3D 모델과 게임을 제작합니다.

    Claude Code나 ChatGPT 구독 계정을 API 키 없이 연결할 수 있습니다. 플레이테스트 결과에 따라 작업을 유지하거나 되돌리고, 에이전트의 작업 방식도 수정합니다.

    왜 중요한가

    게임을 만드는 1인 개발자는 제작부터 플레이테스트 반영까지 이어지는 작업 방식을 살펴볼 수 있습니다.

    10/7 · CHOI Threads

커뮤니티에서 나온 이야기5

  1. 멀티에이전트 작업 전 수행 범위와 책임 경계를 먼저 나누라는 조언

    에이전트에 A를 맡겼는데 B·C까지 끌어와 결과물이 섞이는 사례가 이야기됐습니다. 이를 줄이기 위해 수행 범위, 책임 경계, 중간 체크포인트를 먼저 정하는 방식이 제시됐습니다.

    그렇게 나누기 어려울 때 오케스트레이터와 워커를 두는 방식이 언급됐습니다.

    왜 중요한가

    여러 에이전트의 결과물을 합치는 개발자는 작업 지시와 검토 지점을 더 분명히 정할 수 있습니다.

    10/6 · AI 오픈채팅방

  2. 새 모델을 작업 과정에 넣기 전, 끝낸 작업으로 교차 검증한 사례

    이미 끝낸 작업을 다른 모델에 다시 맡겨 기존 모델이 놓친 오류를 하나라도 찾는지 확인한 사례가 공유됐습니다. 이 시험에서는 새 모델을 작업 과정에 추가하지 않기로 결론 냈습니다.

    왜 중요한가

    모델을 하나 더 쓰려는 팀은 실제 오류 발견 여부로 추가 비용과 단계를 판단할 수 있습니다.

    10/6 · AI 오픈채팅방

  3. AI 작업 세션을 넘길 때 문서로 맥락을 전달하는 방식

    기존 세션에서 핸드오프 문서를 만들고 새 세션이 읽게 하는 방식이 공유됐습니다. 전체 윤곽, 세부 계획, 예시 프롬프트를 각각 파일로 두고 새 세션에서 다음 작업을 이어가는 사례도 있었습니다.

    긴 컨텍스트를 유지하는 편이 낫다는 반대 의견도 나왔습니다. 세션을 비우면 새 세션의 첫 지시를 정확히 쓰는 일이 병목이 될 수 있다는 이유입니다.

    왜 중요한가

    긴 AI 작업을 여러 세션에 걸쳐 진행하는 사람은 인계 문서가 실제로 맥락 손실을 줄이는지 점검할 수 있습니다.

    10/6 · AI 오픈채팅방

  4. 반복 실행은 크론에 맡기고 AI는 자동화 제작에 쓴 사례

    정기 작업을 리눅스 크론으로 실행하고, GPT는 자동화를 만드는 단계에만 쓴다는 사례가 공유됐습니다. 이 방식으로 크론 작업 33개를 운영한다고 합니다.

    왜 중요한가

    같은 지시를 주기적으로 AI에 보내는 운영자는 일반 스크립트로 처리할 수 있는 작업을 가려낼 수 있습니다.

    10/6 · AI 오픈채팅방

  5. 128GB DGX에서 MiniMax H3를 실행해 본 영상 길이의 한계

    한 사용자가 128GB DGX의 메모리를 모두 할당해 MiniMax H3를 로컬에서 실행했지만, 한 번에 만들 수 있는 영상은 8초가 한계였다고 전했습니다. 더 긴 영상은 이어 붙여야 했습니다.

    다만 1.5~2초짜리 컷으로 구성하는 뮤직비디오에는 별도 튜닝 없이 원본 모델로도 충분한 품질이었다고 평가했습니다.

    왜 중요한가

    AI 영상을 로컬에서 제작하려는 사람은 장비와 컷 길이를 정할 때 이 실행 사례를 참고할 수 있습니다.

    10/6 · AI 오픈채팅방