AIPida · 매일의 AI 트렌드
AIPida는 여러 매체가 함께 다룬 AI 소식을 골라 매일 정리합니다. 막히는 지점은 Q&A로 묻고, 실전 가이드·강의로 이어집니다.
Today
오늘의 AI 브리핑
1872, AI 기반 로봇 공장 설립하여 강철 부품 제조
세 명의 전 SpaceX 엔지니어가 AI 기반 소프트웨어와 로봇을 활용하여 강철 부품 제조에 집중하고 있다. 이들은 2027년까지 대부분의 강철 가공 과정을 자동화할 수 있는 프로토타입 공장을 설립할 계획이다. 스타트업 1872는 7월 22일 오하이오주 신시내티의 Factory One 시설에서 공식 출범했다. 초기 목표는 AI 데이터 센터나 소형 모듈 원자로를 개발하는 고객을 위한 강철 스키드 제조 자동화이다. CEO Dan Summers는 80%의 자율 운영을 목표로 하며, 100% 자율 운영으로 가는 것에는 한계가 있을 수 있다고 밝혔다.
1872는 AI 기반 자동화를 통해 강철 스키드 제조를 효율적으로 수행할 계획이다.
Qwen 3.8 27B, 실제 세계 지식 활용 능력 향상
Qwen 3.8 27B 모델은 이전 버전인 Qwen 3.6에 비해 세부 사항을 잘 기억하고 구현하는 능력이 향상되었다. 예를 들어, Qwen 3.6이 만든 'Galaga' 클론은 원작과의 유사성이 부족했으나, Qwen 3.8은 적의 공격, 애니메이션 효과 등을 포함하여 원작에 가까운 결과물을 생성했다. 이 모델은 세부 사항을 고려하여 더 정교한 결과를 만들어내며, 로컬 모델과 상용 모델 간의 격차를 줄이는 데 기여하고 있다.
Qwen 3.8은 세부 사항을 잘 기억하고 구현하여, 게임 개발 시 더 높은 품질의 결과물을 생성할 수 있다.
Activation-Prune-Merge를 통한 모델 스케일 간 지식 전이
Heterogeneous model fusion은 서로 다른 작업, 초기화, 아키텍처 또는 스케일을 가진 모델을 결합하는 방법을 연구한다. Activation-Prune-Merge(APM)라는 프레임워크를 통해, 큰 모델을 작은 아키텍처로 잘라내고 이를 통해 수신 모델의 성능을 향상시킬 수 있음을 보여준다. APM은 16개의 벤치마크에서 원래 3B 수신 모델의 평균 정확도를 55.5%에서 60.6%로 개선했으며, RTE 정확도는 64.3%에서 82.3%, QNLI는 52.3%에서 65.7%, BoolQ는 70.8%에서 79.2%로 증가했다.
불확실성 샘플링에서 오류 노출 및 위치 테스트
이 연구는 불확실성 샘플링이 더 많은 손상된 레이블을 획득하는지 또는 어려운 영역에서의 오류가 특히 해로운지를 테스트한다. 세 가지 공개 이진 표 데이터셋에서 마진 기반 불확실성 샘플링과 무작위 샘플링을 비교하였으며, 100개의 쌍 시드, 0에서 0.30까지의 아홉 가지 예상 노이즈 비율, 20에서 120까지의 주석 예산을 사용하였다. 깨끗한 레이블 하에서 불확실성 샘플링은 모든 데이터셋에서 학습 곡선 아래의 정규화된 균형 정확도를 1.09에서 1.77 포인트 향상시켰다. 그러나 난이도 의존 노이즈는 여섯 개의 비율에서 이 이점을 감소시켰다. 불확실성 샘플링은 레이블 효율적이었지만, 그 강건성은 데이터셋, 예산, 노이즈 구조 및 평가 메트릭에 따라 달라졌다.
불확실성 샘플링은 깨끗한 레이블 하에서 모든 데이터셋에서 정규화된 균형 정확도를 1.09에서 1.77 포인트 향상시켰다.
RubricForge: 에이전트 평가에서 과도한 신뢰를 줄이는 보상 없는 평가 기준 유도
RubricForge는 소규모의 진실 레이블이 있는 경로 집합에서 에이전트 평가 기준의 텍스트를 유도하여 실제 결과에 기반을 두고, 이를 통해 환경 보상과의 일치를 극대화하도록 진화된 평가 기준을 제공한다. 이 방법은 7B 모델을 사용하여 tau-bench와 WebShop에서 평가를 수행했으며, 실패한 경로에 대한 과도한 신뢰를 약 절반으로 줄였다. 예를 들어, tau-bench에서의 잘못된 통과 비율은 0.115로, 기존의 G-Eval보다 개선되었다.
RubricForge는 tau-bench에서 실패한 경로에 대한 잘못된 통과 비율을 0.115로 줄여, 에이전트 평가의 신뢰성을 높인다.
Jais 2: 아랍어 중심의 대형 언어 모델 패밀리
Jais 2는 MBZUAI, Cerebras, Inception이 공동 개발한 아랍어 중심의 대형 언어 모델 패밀리로, 70B 파라미터로 훈련된 가장 큰 오픈 아랍어 중심 LLM을 포함하고 있다. 이 모델은 아랍어 및 문화적 기준 벤치마크에서 강력한 성능을 발휘하며, 8B 파라미터 변형도 경쟁력을 갖춘다. HuggingFace에서 상업적으로 허용된 라이센스 하에 모델이 공개되며, Jais 2 70B는 웹, iOS, Android에서 채팅 앱으로도 제공된다.
Jais 2는 70B 파라미터로 훈련된 아랍어 중심 LLM으로, 아랍어 성능에서 강력한 결과를 보여준다.
Self-Explainable Latent Reasoning (SELR) 프레임워크 소개
Latent reasoning은 텍스트 기반 Chain-of-Thought (CoT) 대신 효율성을 높이는 방법으로 부각되고 있다. 그러나 이러한 압축된 추론은 해석 가능성을 저해한다. 본 연구에서는 효율적이고 본질적으로 설명 가능한 latent reasoning을 수행하는 Self-Explainable Latent Reasoning (SELR) 프레임워크를 제안한다. SELR은 정확한 최종 답변을 생성하기 위한 Answer Loss와 인간이 이해할 수 있는 추론 단계로 디코딩하기 위한 CoT Loss를 동시에 최적화하는 다중 작업 훈련 목표를 가지고 있다. SELR은 Large Language Models (LLMs)와 Vision-Language Models (VLMs)에서 우수한 토큰 효율성과 정확성을 입증하며, 외부 디코더 없이 자체적으로 설명 가능성을 제공한다.
SELR은 효율적이고 해석 가능한 latent reasoning을 통해 모델의 성능을 향상시키고, 외부 디코더 없이도 설명 가능성을 확보한다.
언어 서버가 코딩 에이전트의 토큰을 절약하는가?
코딩 에이전트는 대부분의 컨텍스트 예산을 검색에 사용하며, 언어 서버 프로토콜(LSP)을 통한 의미 검색은 정확하지만 실행 중인 서버가 필요하고 심볼당 왕복 비용이 발생한다. 연구에 따르면, LSP는 토큰 효율성이 낮고, 심볼 이름 로컬라이제이션에서는 LSP가 토큰을 더 소모하며, 참조 완전성에서는 정확성을 제공하지만 토큰 절약은 이루어지지 않는다. 도구 선택은 작업에 따라 달라지며, 모델은 로컬라이제이션에서는 grep을 기본으로 사용하고 참조 작업에서는 LSP를 반 정도 사용한다.
LSP는 심볼 이름 로컬라이제이션에서 +6%에서 +118%의 토큰을 추가로 소모한다.
KRPRVFL 모델: 강인한 이중 모델 협업 랜덤 벡터 기능 링크 네트워크
랜덤 벡터 기능 링크(RVFL) 네트워크는 경량화되고 빠른 신경망 모델로, 랜덤화된 은닉층 가중치와 직접적인 입력-출력 연결을 통해 효율적인 훈련과 강한 일반화를 제공합니다. 그러나 기존 RVFL 모델은 노이즈가 있는 레이블, 이상치 및 불균형 데이터에 민감하여 실제 응용에서 성능이 제한됩니다. 이를 해결하기 위해, KRPRVFL 모델은 RVFL의 계산 효율성과 강인한 KRP 기준을 통합하여, KRP 기반 손실로 표준 최소 제곱 목표를 대체하여 훈련 중 손상된 샘플의 영향을 줄입니다. 또한 협업 학습 메커니즘을 도입하여 모델 구성 요소 간의 적응형 상호작용을 가능하게 하여 복잡하고 노이즈가 많은 환경에서 강인성을 더욱 향상시킵니다. UCI 및 KEEL 벤치마크 데이터셋에서의 실험 결과, KRPRVFL은 정확도와 강인성에서 기준 모델을 지속적으로 초월하는 성능을 보였습니다.
KRPRVFL 모델은 KRP 기반 손실을 통해 훈련 중 손상된 샘플의 영향을 줄여 안정성과 일반화를 개선합니다.
이번 주 AI 하이라이트
지난 7일 주요 소식을 분야별로 정리했습니다
Q&A
지금 많이 묻는 질문
내일부터 Fable이 콘솔 없이 API로만 된다는데, 오늘 안에 뭘 준비해둬야 할까요?
Fable 다시 열렸다는데, 지금 실서비스에 붙여도 될까요?
오픈 가중치 모델 자체 서빙 vs API, 월 토큰 얼마부터 자체 서빙이 이득인가요?
외부 텍스트가 시스템 프롬프트를 덮어썼습니다. 프롬프트 인젝션, 어디부터 막아야 하나요?
tool-calling 에이전트가 존재하지 않는 함수를 반복 호출하며 같은 실패를 되풀이합니다. 무한 재시도를 막는 루프는 어떻게 설계해야 할까요?
Community
개발자들의 실전 기록
시댄스 2.5 리뷰: AI 영상 생성 도구로서의 실력은?
한줄 평가 30초 원패스, 50개 레퍼런스, 4모드 편집 — 기능 조합만으로도 현시점 가장 완성도 높은 AI 영상 생성 도구 중 하나. 도구 개요 시댄스 2.5는 바이트댄스가 2026년 7월 31일 출시한 멀티모달 AI 영상 생성 모델이다. 시댄스 2.0의 후속 버전으로, 텍스트·이미지·비디오·오디오를 동시에 입력받아 영
Fable 콘솔 종료 전에 워크플로를 API로 옮긴 순서와 함정
7/7 콘솔 종료 전 콘솔 워크플로를 Fable API로 이관한 순서·실제 함정·비용 로깅 붙이기
고객 문의 1차 분류 자동화: 룰+LLM 하이브리드로 리드타임 3.5시간→50분
전량 자동화로 한 번 데인 뒤 룰이 걷어내고 LLM이 꼬리를 맡고 사람은 위험한 구간만 보는 구조로 바꾼 기록
멀티에이전트 리서치, 넓은 조사만 이기고 좁은 문제는 토큰 6배 낭비
넓은 탐색은 멀티가 이겼고 좁은 문제는 토큰만 6배 태웠다. when-NOT 판단 기준과 실측 수치
Guides
실전 가이드
LangGraph 실전: PostgresSaver로 중단·재개되는 HITL 승인 워크플로 만들기
interrupt()로 멈추고, Command(resume=)로 이어가고, PostgreSQL에 상태를 영속화하는 패턴
업데이트
바이브 코딩(Vibe Coding) 실전 가이드: 언제 맡기고, 어디서 선을 긋는가
"코드를 잊고 vibes에 맡긴다"가 프로토타입에선 통하고 프로덕션에선 깨지는 경계, 그리고 월요일 아침에 적용할 가드레일
업데이트
AI 브라우저(AI Browser) 직접 만들고 막아보기: 에이전트 브라우징의 메커니즘과 prompt injection
Comet·Atlas가 어떻게 페이지를 읽고 대신 클릭하는지를 미니 에이전트로 재현하고, indirect prompt injection이 왜 이 카테고리의 구조적 결함인지 코드로 확인한다
업데이트
Hermes 입문: 모델·에이전트·데스크톱 한 번에 잡기
Nous Research Hermes의 세 갈래를 구분하고 Hermes Agent를 설치부터 스킬·메모리·배포까지 실무 기준으로 다룬다
업데이트
Tools
이번 주 많이 언급된 툴
중요한 AI 소식만, 메일로 받아보세요
매일 쏟아지는 소식 중 꼭 봐야 할 것만 골라 실무 가이드와 함께 보냅니다.
핵심 뉴스 5 · 추천 가이드 3 · 인기 Q&A