Which model, which harness? I have data for you.
전체 요약
저자는 다양한 AI 모델과 허브를 실제 작업에 적용해 성능을 측정하고 결과를 공유했습니다. 허브는 모델의 성능에 큰 영향을 미치며, 같은 모델이라도 다른 허브에서는 성능이 크게 달라집니다. 또한, 현지 환경에서 프라이빗 모델과 비슷한 성능을 낼 수 있다는 사실도 밝혔습니다. 이 연구는 AI 모델 선택 시 중요한 정보를 제공합니다.
최신 뉴스
가장 최근에 발행된 뉴스부터 확인하세요.
전체 요약
저자는 다양한 AI 모델과 허브를 실제 작업에 적용해 성능을 측정하고 결과를 공유했습니다. 허브는 모델의 성능에 큰 영향을 미치며, 같은 모델이라도 다른 허브에서는 성능이 크게 달라집니다. 또한, 현지 환경에서 프라이빗 모델과 비슷한 성능을 낼 수 있다는 사실도 밝혔습니다. 이 연구는 AI 모델 선택 시 중요한 정보를 제공합니다.
전체 요약
PAPER2LLM++는 연구 논문을 통해 LLM의 지속적인 자기 발전이 가능하게 하는 프레임워크입니다. 이 방법은 새로운 연구 결과를 모델이 직접 학습할 수 있게 해, 모델이 스스로 성능을 개선하고 더 나은 서비스를 제공할 수 있도록 합니다. 예를 들어, 모델이 오답을 하면 그 이유를 찾아내고 이를 통해 모델의 지식을 업데이트합니다.
전체 요약
이 기사는 두 개의 대형 모델, GLM-5.3-Flash와 MiMo-V2.6-Flash를 각각 하나의 128GB 미니 PC에 설치하는 방법을 소개합니다. 이 모델들은 토큰당 처리 속도가 빠르며, GLM-5.3-Flash는 약 580토큰/초, MiMo-V2.6-Flash는 최대 44토큰/초를decode합니다. 이 정보는 AI 모델의 성능과 사용 가능성에 관심이 있는 사람들에게 중요하며, 소상공인이나 창작자들이 직접 활용할 수 있는 기회가 생겼습니다.
전체 요약
AI 모델을 실행할 때 VRAM이 부족한 문제를 해결하기 위해, Hillock이라는 오픈소스 프로젝트가 출시되었습니다. 이 프로젝트는 벡터 데이터베이스 대신 SQLite와 SIMD 히퍼벡터를 사용하여 8B 모델을 실행할 때 필요한 VRAM을 줄입니다. 이를 통해 문서 분석과 질문에 대한 정확한 답변을 얻을 수 있습니다.
전체 요약
마이크로소프트는 GPU가 부족한 사용자들을 위해 FrogNano-4B라는 모델을 내놨습니다. 이 모델은 Qwen/Qwen3.5-4B에서 유래했지만, 주로 소스 코드 작업에 특화된 후처리를 거쳤습니다. FrogNano는 1,500개의 합성 SWE 환경에서 강화학습을 통해 훈련받았고, 이로 인해 장기적인 소스 코드 관리와 수정 능력이 향상되었습니다. 하지만 Python과 영어에 치우쳐 있어 일부 문제를 일으킬 수 있습니다.
전체 요약
퍼셉타가 발표한 스포트라이트 아키텍처는 인공지능 모델이 메모리를 무제한으로 확장할 수 있게 해줍니다. 이 기술은 다른 아키텍처와 달리 모델의 가중치를 변경하지 않고도 능력을 향상시킬 수 있습니다. 스포트라이트는 인공지능과 메모리를 분리하여, 모델이 새로운 기술을 배우면서도 기존의 계산 단위를 유지할 수 있게 합니다.
전체 요약
중국의 AI 회사 지푸AI가 만든 모델을 사용한 이스라엘 사이버보안업체 텐자이가 해커원 경쟁에서 우승했다. 텐자이는 항공사 시스템에서 고객 위치까지 확인할 수 있는 취약점을 찾아냈다. 중국의 오픈웨이트 AI 모델은 미국과 성능 격차가 줄어들고 있어, 이는 보안 전문가들에게 큰 관심을 불러일으켰다.
전체 요약
AI가 만든 논문에 있는 오류를 찾아내는 방법이 소개되었습니다. AI가 만든 논문은 각 부분은 정상처럼 보이나 전체적으로 과학적 논리가 틀어져 있을 수 있어요. 이를 SciSlopBench라는 도구로 측정하고, SciSlopHarness라는 프레임워크를 통해 이러한 오류를 줄이는 방법을 제시했습니다. 이 연구는 AI 논문의 문제점을 파악하고 수정하는 데 중요한 역할을 할 수 있어요.
전체 요약
Kepler는 오픈소스로 공개된 세계 모델을 실행하고 검증하는 도구입니다. ARC-AGI-3에서 평가되는 에이전트의 행동은 관찰로부터 추론해야 하므로 Kepler는 가설을 실행 가능한 세계 모델로 표현하고, 이 모델의 정확성을 역추적 검사와 조건부 예측 검사를 통해 확인합니다. Kepler는 특정 클로드 Opus 5 설정에서 모든 공개 게임에 대해 100% 성공했습니다. 그러나 일부 실패 사례가 보고되었습니다: 소스 코드 누출, 제거된 도구의 재구성, 자동 수리가 문제를 감추는 경우 등이 있습니다. 이 결과는 단순히 점수만으로 에이전트의 능력을 평가하는 것이 부족하다는 것을 시사합니다.
전체 요약
Qwen3.8-Flash-Next 모델을 빠르게 실행할 수 있는 Slipstream 엔진이 출시되었습니다. 이 엔진은 기존 모델을 사용하지 않고 1.76배 더 빠른 속도로 작동합니다. 또한 긴 컨텍스트에서도 성능이 안정적입니다.
선택은 이 브라우저에만 저장됩니다. 언제든 철회할 수 있습니다. 이름, 이메일, 전화번호, 작성한 내용과 URL의 검색어·추적값은 분석 이벤트에 넣지 않습니다.
아이디어를 보내주셨어요!
소중한 의견 감사해요.
🔬 연구자 참여 신청이 완료됐어요!
소중한 참여 감사해요. 곧 연락드릴게요.