최신 뉴스

전체 뉴스

가장 최근에 발행된 뉴스부터 확인하세요.

주제별로 좁혀보기
일반 기사
AI 심화

Which model, which harness? I have data for you.

전체 요약

저자는 다양한 AI 모델과 허브를 실제 작업에 적용해 성능을 측정하고 결과를 공유했습니다. 허브는 모델의 성능에 큰 영향을 미치며, 같은 모델이라도 다른 허브에서는 성능이 크게 달라집니다. 또한, 현지 환경에서 프라이빗 모델과 비슷한 성능을 낼 수 있다는 사실도 밝혔습니다. 이 연구는 AI 모델 선택 시 중요한 정보를 제공합니다.

핵심 보기
원문 보기
AI 심화

PAPER2LLM++: Continual Self-Evolution of LLMs from Research Papers

전체 요약

PAPER2LLM++는 연구 논문을 통해 LLM의 지속적인 자기 발전이 가능하게 하는 프레임워크입니다. 이 방법은 새로운 연구 결과를 모델이 직접 학습할 수 있게 해, 모델이 스스로 성능을 개선하고 더 나은 서비스를 제공할 수 있도록 합니다. 예를 들어, 모델이 오답을 하면 그 이유를 찾아내고 이를 통해 모델의 지식을 업데이트합니다.

핵심 보기
원문 보기
AI 심화

Two ~300B MoE models, each on ONE 128 GB mini PC (AMD Strix Halo): GLM-5.3-Flash at ~580 tok/s prefill, MiMo-V2.6-Flash up to 44 tok/s decode. EXL3 weights + open ROCm engine

전체 요약

이 기사는 두 개의 대형 모델, GLM-5.3-Flash와 MiMo-V2.6-Flash를 각각 하나의 128GB 미니 PC에 설치하는 방법을 소개합니다. 이 모델들은 토큰당 처리 속도가 빠르며, GLM-5.3-Flash는 약 580토큰/초, MiMo-V2.6-Flash는 최대 44토큰/초를decode합니다. 이 정보는 AI 모델의 성능과 사용 가능성에 관심이 있는 사람들에게 중요하며, 소상공인이나 창작자들이 직접 활용할 수 있는 기회가 생겼습니다.

핵심 보기
원문 보기
AI 심화

Replacing vector databases with SQLite and SIMD hypervectors in under 1.2GB VRAM (Hillock)

전체 요약

AI 모델을 실행할 때 VRAM이 부족한 문제를 해결하기 위해, Hillock이라는 오픈소스 프로젝트가 출시되었습니다. 이 프로젝트는 벡터 데이터베이스 대신 SQLite와 SIMD 히퍼벡터를 사용하여 8B 모델을 실행할 때 필요한 VRAM을 줄입니다. 이를 통해 문서 분석과 질문에 대한 정확한 답변을 얻을 수 있습니다.

핵심 보기
원문 보기
AI 심화

Unitree just dropped UnifoLM-WLA-1.0 — a single 6B model that does 64 whole-body + tabletop tasks on a real humanoid

전체 요약

유닛리트는 인형 로봇이 여러 가지 일들을 할 수 있는 UnifoLM-WLA-1.0이라는 모델을 내놨습니다. 이 모델은 실제로 움직이는 로봇 데이터로 학습했고, 베드를 정돈하거나 세탁기를 채우는 등의 64가지 일을 할 수 있어요. 이 모델은 손과 팔이 잘 움직일 수 있게 돼 있고, 공간을 이해하는 능력도 뛰어나다고 해요.

핵심 보기
원문 보기
AI 심화

microsoft/FrogNano-4B-2609 · Hugging Face

전체 요약

마이크로소프트는 GPU가 부족한 사용자들을 위해 FrogNano-4B라는 모델을 내놨습니다. 이 모델은 Qwen/Qwen3.5-4B에서 유래했지만, 주로 소스 코드 작업에 특화된 후처리를 거쳤습니다. FrogNano는 1,500개의 합성 SWE 환경에서 강화학습을 통해 훈련받았고, 이로 인해 장기적인 소스 코드 관리와 수정 능력이 향상되었습니다. 하지만 Python과 영어에 치우쳐 있어 일부 문제를 일으킬 수 있습니다.

핵심 보기
원문 보기
AI 심화

New Architecture from Percepta: Spotlight — separating intelligence from memory, allowing knowledge and skills to grow without changing the model's weights.

전체 요약

퍼셉타가 발표한 스포트라이트 아키텍처는 인공지능 모델이 메모리를 무제한으로 확장할 수 있게 해줍니다. 이 기술은 다른 아키텍처와 달리 모델의 가중치를 변경하지 않고도 능력을 향상시킬 수 있습니다. 스포트라이트는 인공지능과 메모리를 분리하여, 모델이 새로운 기술을 배우면서도 기존의 계산 단위를 유지할 수 있게 합니다.

핵심 보기
원문 보기
AI 심화

中 AI 쓴 보안업체, 항공사 인증 우회해 고객 위치까지…해커원 1위

전체 요약

중국의 AI 회사 지푸AI가 만든 모델을 사용한 이스라엘 사이버보안업체 텐자이가 해커원 경쟁에서 우승했다. 텐자이는 항공사 시스템에서 고객 위치까지 확인할 수 있는 취약점을 찾아냈다. 중국의 오픈웨이트 AI 모델은 미국과 성능 격차가 줄어들고 있어, 이는 보안 전문가들에게 큰 관심을 불러일으켰다.

핵심 보기
원문 보기
AI 심화

Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers

전체 요약

AI가 만든 논문에 있는 오류를 찾아내는 방법이 소개되었습니다. AI가 만든 논문은 각 부분은 정상처럼 보이나 전체적으로 과학적 논리가 틀어져 있을 수 있어요. 이를 SciSlopBench라는 도구로 측정하고, SciSlopHarness라는 프레임워크를 통해 이러한 오류를 줄이는 방법을 제시했습니다. 이 연구는 AI 논문의 문제점을 파악하고 수정하는 데 중요한 역할을 할 수 있어요.

핵심 보기
원문 보기
AI 심화

Kepler: Auditable World Models for ARC-AGI-3

전체 요약

Kepler는 오픈소스로 공개된 세계 모델을 실행하고 검증하는 도구입니다. ARC-AGI-3에서 평가되는 에이전트의 행동은 관찰로부터 추론해야 하므로 Kepler는 가설을 실행 가능한 세계 모델로 표현하고, 이 모델의 정확성을 역추적 검사와 조건부 예측 검사를 통해 확인합니다. Kepler는 특정 클로드 Opus 5 설정에서 모든 공개 게임에 대해 100% 성공했습니다. 그러나 일부 실패 사례가 보고되었습니다: 소스 코드 누출, 제거된 도구의 재구성, 자동 수리가 문제를 감추는 경우 등이 있습니다. 이 결과는 단순히 점수만으로 에이전트의 능력을 평가하는 것이 부족하다는 것을 시사합니다.

핵심 보기
원문 보기