Weekly Trends
이 목록은 weekly-trends 파이프라인이 자동으로 갱신하며, 등록된 지 30일이 지난 논문은 자동으로 목록에서 정리됩니다.
팀원 수동 팔로업
- 아직 등록된 논문이 없습니다.
AI 자동 수집·요약
-
MatrAIx는 83억 개의 다양한 페르소나를 활용해 AI 시스템 평가를 혁신적으로 자동화하는 인프라를 제안한다.
-
COLLEAGUE.SKILL은 전문가 지식을 증류하여 개인화된 AI 기술을 자동 생성하는 시스템을 제안한다.
-
Unlimited OCR는 인간의 작업 기억을 모방하여 긴 출력 시퀀스에서도 메모리 소비를 줄이고 효율성을 유지하는 혁신적인 OCR 모델이다.
-
MerchantBench는 LLM 에이전트의 장기적 일관성을 평가하기 위한 새로운 벤치마크를 제시한다.
-
CUDA Agent는 강화 학습 기반으로 CUDA 커널 생성을 최적화하여 기존 시스템보다 성능을 크게 향상시킵니다.
-
BDH-CQ는 반복적인 잠재 추론을 통해 비용 효율성을 극대화하며 새로운 상태의 성능을 달성한 모델이다.
-
Macaron-V1은 지속적인 학습을 위한 Mixture-of-LoRA 아키텍처와 자기 개선 메커니즘을 결합한 개방형 에이전트 모델이다.
-
Spark-to-Paper는 연구 아이디어를 완전한 논문으로 변환하는 통합 시스템을 제시한다.
-
OpenART는 환경 진화를 통한 에이전트 레드 팀 작업을 확장할 수 있는 새로운 평가 플랫폼을 제시한다.
-
U-OPSD는 외부 감독 없이 모델의 자체 생성물만으로 자기 증류를 수행하여 성능을 향상시킵니다.
-
ComBodied Agents는 개인의 상태와 주체성을 중심으로 AI의 모델링과 지원을 혁신하는 새로운 패러다임을 제시한다.
-
Latent-to-4D는 비디오 모델의 잠재 공간을 활용하여 효율적인 4D 장면 생성을 가능하게 한다.
-
이 논문은 에이전트 시스템의 자율적 진화를 위한 공동 진화 개념과 이를 위한 체계적 분류를 제안한다.
-
SWE-Bench ProMax는 다국어 코드 리팩토링을 위한 170개의 고품질 벤치마크를 제공하여 AI 코딩 에이전트의 성능 평가를 개선한다.
-
Alaya-EVOKE는 외부 세계 상태 저장과 장기 상호작용 생성을 통해 모델의 메모리와 성능을 최적화합니다.
-
Xiaomi-Robotics-1은 10만 시간 이상의 실제 데이터를 활용해 다양한 작업을 수행할 수 있는 VLA 모델을 제안한다.
-
Kimi K3는 2.8T 파라미터의 Mixture-of-Experts 모델로, 다양한 작업에서 성능을 크게 향상시켰습니다.
-
InfiniSplat은 픽셀 정렬 대신 표면 정렬을 통해 단일 이미지로부터 더 나은 3D 장면 표현을 생성한다.
-
HPD-Parsing은 문서 구조를 계층적으로 분석하고 병렬로 콘텐츠를 처리하여 기존 모델보다 2.62배 빠른 성능을 보여준다.
-
INTACT는 행동 레이블이 있는 경로를 활용하여 검색 없이 의도에서 행동으로의 전환을 가능하게 하는 혁신적인 모델이다.
-
JoyAI-Video-Edit는 실시간 비디오 편집을 위한 혁신적인 16B 파라미터 자가 회귀 확산 프레임워크를 제안합니다.
-
MemHarness는 LLM 에이전트가 과거 경험을 현재 상황에 맞게 재구성하도록 하여 성능을 향상시킵니다.
-
LeRobot는 로봇 학습의 모든 단계를 통합한 오픈소스 라이브러리로, 접근성과 확장성을 강조하여 연구 개발을 촉진한다.
-
AI-Infra-Guard는 AI 에이전트의 다층 보안을 위한 통합 프레임워크로, 다양한 공격 표면을 효과적으로 방어할 수 있는 방법을 제시한다.
-
HelloWorld는 비디오 월드 모델에서 사용자와 캐릭터 간의 자연스러운 사회적 상호작용을 가능하게 하는 혁신적인 시스템이다.
-
이 논문은 고품질의 장기 목표 작업을 저비용으로 생성할 수 있는 재귀적 합성 프레임워크를 제안한다.
-
LongHorizon-Harness는 장기 과제 수행에서 상태 관리 문제를 해결하여 성능을 크게 향상시킵니다.
-
SwanTale은 다중 화자 음성 및 오디오 생성을 위한 혁신적인 모델로, 지시 및 제로샷 작업을 지원한다.
-
이 논문은 자율주행 모델의 추론 능력을 향상시키기 위해 미래 경로의 노출을 지연시키는 새로운 접근 방식을 제안한다.
-
DAPD는 정보 비대칭 문제를 해결하여 언어 모델의 성능 저하를 방지하는 새로운 정책 증류 방법을 제안한다.
-
Fish Audio S2는 다중 화자 및 자연어 지시를 따르는 텍스트-음성 변환 시스템으로, 오픈소스로 제공된다.
-
MonkeyOCRv2는 문서 AI를 위한 비주얼-텍스트 모델로, 대규모 문서 이미지 데이터셋과 혁신적인 사전 학습 전략을 통해 성능을 향상시킵니다.
-
Frontis-MA1은 기계 학습 공학에서 자기 개선을 위한 메타 진화 에이전트를 제안하여 성능을 크게 향상시켰다.
-
이 논문은 ASR 모델의 전사 스타일을 제어 가능하게 하여 정확성과 신뢰성을 크게 향상시키는 방법을 제시한다.
-
Molt는 연구자가 쉽게 이해하고 수정할 수 있는 PyTorch 기반의 에이전틱 강화 학습 훈련 프레임워크를 제공한다.
-
CodeNib는 코드 에이전트의 효율성을 높이기 위해 다중 뷰 데이터 시스템을 구축하여 리포지토리 컨텍스트를 효과적으로 제공한다.
-
MuScriptor는 다양한 악기가 포함된 실제 음악 녹음에서 효과적으로 작동하는 다중 악기 음악 전사 모델을 제안합니다.
-
DataFlex는 대규모 언어 모델의 데이터 중심 동적 훈련을 통합적으로 지원하는 프레임워크이다.
-
SkillClaw은 다중 사용자 에이전트 생태계에서 기술의 집단 진화를 통해 경험을 공유하고 개선할 수 있는 프레임워크를 제안한다.
-
RESOURCE2SKILL은 다양한 멀티모달 자원에서 실행 가능한 에이전트 기술을 추출하여 효율성을 높이는 혁신적인 프레임워크이다.
-
EvoScientist는 지속적인 메모리와 자기 진화를 통해 AI 과학자의 연구 전략을 개선하는 다중 에이전트 프레임워크를 제안한다.
-
SearchOS는 정보 탐색 에이전트의 협업을 개선하여 검색 효율성을 높이는 혁신적인 프레임워크를 제안한다.
-
ABot-World-0는 다양한 데이터 소스를 활용해 실시간 상호작용을 지원하는 비디오 월드 모델을 제안한다.
-
RynnBrain 1.1은 로봇 조작에 최적화된 통합 모델로, 다양한 임무에서 뛰어난 성능을 보여준다.
-
TimeLens2는 비디오의 시간적 근거를 정확히 예측하는 혁신적인 멀티모달 모델을 제안한다.
-
RAGU는 지식 그래프 생성을 개선하여 더 정확하고 효율적인 GraphRAG 엔진을 제공한다.
-
AREX는 연구 에이전트가 중간 결과를 검증하며 스스로 개선하는 새로운 접근 방식을 제시한다.
-
DataFlow-Harness는 LLM을 활용해 데이터 파이프라인을 효율적으로 구축할 수 있는 플랫폼을 제안한다.
-
EvolvingWorld는 캐릭터와 세계의 동시 진화를 지원하는 개방형 프레임워크를 제시하여 상호작용 문학 시뮬레이션의 한계를 극복한다.
-
DeepSearch-World는 웹 에이전트의 자기 진화를 위한 검증 가능한 환경을 제공하여 성능 향상을 이끈다.
-
SWE-Pruner Pro는 코드 에이전트의 내부 표현을 활용해 효율적으로 도구 출력을 가지치기하여 성능을 향상시킵니다.
-
Moonshine v2는 슬라이딩 윈도우 자기 주의 메커니즘을 통해 저지연 음성 인식을 가능하게 하여 성능을 크게 향상시킵니다.
-
Long-Horizon-Terminal-Bench는 에이전트의 장기 목표 수행 능력을 평가하기 위한 새로운 벤치마크를 제시한다.
-
KnowAct-GUIClaw는 사용자 경험을 활용하여 GUI 상호작용을 개선하고 지속적인 학습을 통한 성능 향상을 가능하게 하는 개인 비서 프레임워크를 제안한다.
-
로봇 정책 평가를 위한 세계 모델의 신뢰성을 체계적으로 연구하고 WMBench 벤치마크를 제안한다.
-
TorchUMM는 다양한 멀티모달 모델을 평가하고 분석할 수 있는 통합 코드베이스를 제공한다.
-
Kairos는 다양한 경험에서 세계 지식을 획득하고 장기 상태를 유지하는 물리적 AI를 위한 혁신적인 세계 모델 스택이다.
-
VideoChat3는 완전 개방형 비디오 MLLM으로, 효율적이고 일반화된 비디오 이해를 가능하게 한다.
-
이 논문은 다양한 시각 작업을 통합된 다중 모달 생성으로 처리하는 새로운 접근 방식을 제안한다.
-
SafePred는 컴퓨터 사용 에이전트의 행동을 안전하게 유지하기 위해 미래 위험을 예측하는 새로운 가드레일 프레임워크를 제안한다.
-
이 논문은 AI 에이전트의 진화하는 하네스를 효과적으로 수정할 수 있는 행동 중심의 표현 방식을 제안한다.
-
LongStraw는 고정 GPU 예산 내에서 2M 이상의 토큰을 처리할 수 있는 RL 후처리 아키텍처를 제안한다.
-
Direct On-Policy Distillation은 약한 모델의 RL 신호를 강한 모델에 효과적으로 전이하여 학습 효율성을 높인다.
-
Boogu-Image-0.1은 경쟁력 있는 성능을 가진 오픈소스 멀티모달 모델로, 텍스트-이미지 생성 및 편집에서 우수한 결과를 보여준다.
-
이 논문은 코드 에이전트의 중간 훈련을 통해 외부 도구 통합 능력을 향상시키는 새로운 방법론을 제시한다.
-
ABot-N1은 비주얼 언어 내비게이션 모델의 인지와 제어를 분리하여 다양한 임무를 효과적으로 수행하도록 개선한 기여를 한다.