최신 뉴스

전체 뉴스

가장 최근에 발행된 뉴스부터 확인하세요.

주제별로 좁혀보기
일반 기사
AI 심화

비드래프트, 법률 데이터 학습 없이 글로벌 벤치마크 1위 달성

전체 요약

비드래프트의 AI 모델 '다윈-180B-RSI'는 법률 추론 벤치마크에서 세계 최고 점수를 받았다. 이 모델은 스스로 문제를 풀고 검증하는 방식으로 학습해, 인간이 정답을 입력하지 않은 상태에서도 성능을 높였다. 이 결과는 AI가 더 독립적으로 문제 해결 능력을 발휘할 수 있음을 보여준다.

핵심 보기
원문 보기
AI 심화

We benchmarked 18 RAG pipelines against an agent loop on Google's FRAMES. The best pipeline hit 78.9%. The agent loop hit 92.7%.

전체 요약

연구자들은 18가지 RAG 파이프라인을 테스트해보았습니다. 최고의 파이프라인이 78.9%를 얻었지만, 에이전트 루프는 92.7%까지 성능을 끌어올렸습니다. 이는 모델에게 필요한 정보만 주는 것과 비슷한 결과입니다. 재랭킹 기술은 예상보다 덜 효과적이었습니다. 또한, 모델은 때로는 기억에서 정보를 채워넣기도 합니다.

핵심 보기
원문 보기
AI 심화

AgBench: Agentic AI Benchmarks for Personal AI Devices

전체 요약

AI 기기의 성능을 측정하는 새로운 도구, AgBench가 발표되었습니다. 이 도구는 개인 AI 기기에 대한 실행 방식과 관련된 문제를 조사하는데 사용됩니다. 클라우드에서 실행되는 모델이 비용과 정보 노출에 영향을 미치기 때문에, 로컬에서 실행되는 AI 기기가 어떤 작업을 얼마나 잘 수행하는지 알아보려고 합니다. AgBench는 여러 실험 결과로, 개인 AI 기기에 대한 다양한 실행 방식의 성능을 평가할 수 있게 해줍니다.

핵심 보기
원문 보기
AI 심화

AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks

전체 요약

AREX-2는 AI가 스스로 성능을 향상시키는 능력을 강화하기 위한 연구입니다. 이 연구에서는 AI가 더 나은 해결책을 찾고, 장기적으로 효과를 유지할 수 있는 두 가지 기술을 학습하게 합니다. AREX-2는 Qwen3.8-27B이라는 모델을 사용해 여러 테스트에서 좋은 성과를 보였습니다. 이 연구는 AI가 스스로 발전하는 데 중요한 단서를 제공합니다.

핵심 보기
원문 보기
AI 심화

BAAI/AREX-2 - 27B - Agent model based on Qwen3.8 27B

전체 요약

AREX-2는 Beijing Academy of Artificial Intelligence (BAAI)에서 개발한 270억 매개변수의 장기적 전략 모델입니다. AREX-2는 테스트 시간에 여러 번 반복하여 문제 해결 방안을 제시하고, 측정, 반성, 수정하는 과정을 통해 스스로를 개선합니다. 이 모델은 코드 작성과 머신러닝 작업을 학습하면서 깊이 있는 연구 성능도 향상시킵니다. AREX-2는 Qwen3.8과 호환되는 밀집형 다중모드 모델입니다.

핵심 보기
원문 보기
AI 심화

Right Words, Wrong Moment: A Clinician-Grounded Analysis of Distress in 19,930 Conversations between Young People and ChatGPT

전체 요약

연구자들은 청년들이 어려움을 겪을 때 챗봇인 ChatGPT를 자주 이용한다는 것을 알아냈습니다. 19,000여 대화와 설문 조사를 분석한 결과, 고민하는 청년들은 ChatGPT와의 대화에서 더 많은 감정을 풀어냈고, 행동 변화도 보였습니다. 하지만 일부 청년은 과하게 반응하거나 너무 빨리 해결책을 제시하는 ChatGPT에 불편함을 느꼈습니다. 의사들이 이 문제를 해결하기 위해 안전성 확인부터 시작해서 감정을 조절하고, 문제점을 따로 살펴보는 세 단계의 지침을 만들었습니다.

핵심 보기
원문 보기
AI 심화

An Empirical Study and Assessment of EU AI Act Compliance Checkers

전체 요약

유럽 연합의 AI 법안에 대한 여러 자동 검사 도구가 등장했지만, 이들은 아직 완전한 안내 도구가 되지 못하고 있습니다. 이 연구는 이러한 도구들이 얼마나 잘 작동하는지를 체크해 보았습니다. 검사 결과, 현재 사용 가능한 도구들은 사용자 친화적이지 않고, 중요한 의무를 간과하거나 너무 단순화하여 실질적인 조언을 제공하지 못하고 있습니다.

핵심 보기
원문 보기
AI 심화

Towards an AI Software Factory for Data Systems

전체 요약

이 연구는 AI가 소프트웨어 개발 전 과정을 가속화하는 데 초점을 맞추고 있습니다. Microsoft에서의 대규모 배포 결과, 엔지니어링 효율성이 3배 증가했으며 토큰 효율성은 최대 22배까지 올랐습니다. 이 연구는 AI SW 제조 공장이 데이터 시스템과 진화적 코드 작업을 지원하는 데 중요한 역할을 합니다.

핵심 보기
원문 보기