최신 뉴스

전체 뉴스

가장 최근에 발행된 뉴스부터 확인하세요.

주제별로 좁혀보기 · 개발·코딩
일반 기사
AI 심화

Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers

전체 요약

AI가 만든 논문에 있는 오류를 찾아내는 방법이 소개되었습니다. AI가 만든 논문은 각 부분은 정상처럼 보이나 전체적으로 과학적 논리가 틀어져 있을 수 있어요. 이를 SciSlopBench라는 도구로 측정하고, SciSlopHarness라는 프레임워크를 통해 이러한 오류를 줄이는 방법을 제시했습니다. 이 연구는 AI 논문의 문제점을 파악하고 수정하는 데 중요한 역할을 할 수 있어요.

핵심 보기
원문 보기
AI 심화

Kepler: Auditable World Models for ARC-AGI-3

전체 요약

Kepler는 오픈소스로 공개된 세계 모델을 실행하고 검증하는 도구입니다. ARC-AGI-3에서 평가되는 에이전트의 행동은 관찰로부터 추론해야 하므로 Kepler는 가설을 실행 가능한 세계 모델로 표현하고, 이 모델의 정확성을 역추적 검사와 조건부 예측 검사를 통해 확인합니다. Kepler는 특정 클로드 Opus 5 설정에서 모든 공개 게임에 대해 100% 성공했습니다. 그러나 일부 실패 사례가 보고되었습니다: 소스 코드 누출, 제거된 도구의 재구성, 자동 수리가 문제를 감추는 경우 등이 있습니다. 이 결과는 단순히 점수만으로 에이전트의 능력을 평가하는 것이 부족하다는 것을 시사합니다.

핵심 보기
원문 보기
AI 입문

구글 AI칩 우주로…'우주 데이터센터' 첫 궤도 실험

전체 요약

구글이 인공지능(AI) 칩을 탑재한 시제품 위성을 스페이스X 로켓을 통해 궤도에 보냈다. 이는 빅테크들이 추진하는 우주 데이터센터 구상을 실제 실험 단계로 이끌어낸 첫 사례다. 구글은 저궤도 위성에서 AI 연산을 수행할 수 있는지 검증하고, 장기적으로는 대규모 AI 연산을 처리하기 위한 계획이다. 하지만 높은 로켓 발사 비용과 우주 쓰레기 문제 등 해결해야 할 과제가 남아 있다. 원문에 구체적 데이터 미제시

핵심 보기
원문 보기
AI 활용

오픈클로, 기업용 AI 에이전트 제어 플랫폼 'OCE' 공개

전체 요약

오픈클로가 MIT 라이선스에 따라 무료로 제공하는 기업용 AI 에이전트 제어 플랫폼 'OCE'를 출시했다. 이 플랫폼은 기업이 AI 에이전트의 운영을 중앙에서 관리할 수 있도록 설계되었으며, 특정 AI 모델이나 공급업체에 종속되지 않아 유연성이 높다. 원문에는 구체적인 데이터가 없어, 실제 사용 시 어떤 혜택을 얻을지는 아직 명확하지 않다.

핵심 보기
원문 보기
AI 활용

인셉션, 음성 에이전트 ‘머큐리 보이스’ 출시…'확산 모델'로 지연시간 한계 깼다

전체 요약

인셉션은 음성 에이전트 ‘머큐리 보이스’를 출시했어요. 이 모델은 확산 기반 언어모델로, 기존 자율주행이나 이미지 생성에 쓰이는 방식을 음성 영역으로 확장해 더 빠르고 똑똑한 대화가 가능하게 만들었죠. 2026년 9월 29일부터 기업 고객에게 제공되고 있어요.

핵심 보기
원문 보기
AI 심화

비드래프트, 법률 데이터 학습 없이 글로벌 벤치마크 1위 달성

전체 요약

비드래프트의 AI 모델 '다윈-180B-RSI'는 법률 추론 벤치마크에서 세계 최고 점수를 받았다. 이 모델은 스스로 문제를 풀고 검증하는 방식으로 학습해, 인간이 정답을 입력하지 않은 상태에서도 성능을 높였다. 이 결과는 AI가 더 독립적으로 문제 해결 능력을 발휘할 수 있음을 보여준다.

핵심 보기
원문 보기
AI 심화

We benchmarked 18 RAG pipelines against an agent loop on Google's FRAMES. The best pipeline hit 78.9%. The agent loop hit 92.7%.

전체 요약

연구자들은 18가지 RAG 파이프라인을 테스트해보았습니다. 최고의 파이프라인이 78.9%를 얻었지만, 에이전트 루프는 92.7%까지 성능을 끌어올렸습니다. 이는 모델에게 필요한 정보만 주는 것과 비슷한 결과입니다. 재랭킹 기술은 예상보다 덜 효과적이었습니다. 또한, 모델은 때로는 기억에서 정보를 채워넣기도 합니다.

핵심 보기
원문 보기