최신 뉴스

전체 뉴스

가장 최근에 발행된 뉴스부터 확인하세요.

주제별로 좁혀보기 · 개발·코딩
일반 기사
AI 활용

Flyweight: open-source C++/CUDA engine for running MoE models bigger than your VRAM on one GPU + system RAM. First PyPI release, looking for contributors.

전체 요약

AI 모델 중 일부는 그래픽 카드 메모리보다 크기 때문에, 이 도구는 그런 모델을 실행할 수 있게 해줍니다. 사용자는 하나의 NVIDIA 카드와 많은 RAM으로 여러 AI 모델을 돌릴 수 있습니다. 예를 들어, Qwen 3.x 모델은 이 도구로 실행됩니다. 토큰당 처리 속도가 다르지만, 전체적으로는 빠르게 작동합니다.

핵심 보기
원문 보기
AI 활용

클라우드플레어, AI 크롤러 통제 강화…검색·학습 분리

전체 요약

클라우드플레어는 웹사이트의 검색 노출을 유지하면서 AI 학습용 콘텐츠 수집만 차단할 수 있는 기능을 도입했다. 이로 인해 웹사이트 운영자는 검색과 AI 학습을 분리하여 관리할 수 있게 됐다. 예를 들어, 검색엔진 크롤러는 여전히 정보를 가져갈 수 있지만 AI 회사는 콘텐츠를 수집하지 못하게 된다.

핵심 보기
원문 보기
AI 활용

클로드 코드 컴팩션, 요약 말고 지우기: Jev 플러그인은 툴 기록만 골라서 버려요

전체 요약

클로드 코드 컴팩션은 요약 프롬프트를 사용하지 않고 필요한 툴 호출만 남기는 플러그인입니다. 타마라 트란이 제작한 이 플러그인은 Jev에게 질문을 던져 필요 없는 툴 호출과 결과를 지우게 합니다. 30일 동안 클로드 코드 세션에서 툴 호출 비율이 80%였습니다. 이 플러그인은 CLAUDE_CODE_ENABLE_FUNCTION_HOOKS 설정을 켜야 사용 가능하며, Jev API 키가 필요합니다.

핵심 보기
원문 보기
AI 심화

Characterizing Web Search by Conversational LLM Agents: From Search Decisions and Strategies to Results and Responses

전체 요약

대화형 LLM 에이전트들이 웹 검색을 어떻게 사용하는지 처음으로 연구했습니다. ChatGPT, Claude, Grok, DeepSeek 네 가지 플랫폼에서 실제 사용자와 실험을 통해 웹 검색의 품질과 전략을 분석했어요. 각 플랫폼마다 웹 검색 결정이 다르고, 더 자주 웹 검색을 하더라도 답변 품질은 항상 좋아지지는 않아요. 이 연구는 대화형 에이전트들이 어떻게 웹 정보를 활용하는지를 알려줍니다.

핵심 보기
원문 보기
AI 심화

A Unified Evaluation Framework for Trustworthy Large Language Models, Agentic AI, and Multimodal Systems

전체 요약

이 연구는 대형 언어 모델, 에이전트 AI 및 다중모드 시스템의 신뢰성 평가를 위한 통합 프레임워크를 제안합니다. 이 프레임워크는 능력, 안정성, 공정성 등 8개의 신뢰성 차원을 통해 시스템 성능과 증거의 신뢰성을 함께 평가합니다. 그러나 구체적인 데이터나 수치가 없어 정보 부족이 있습니다.

핵심 보기
원문 보기
AI 심화

Geopolitical Divisions Across Languages in Large Language Models

전체 요약

AI 챗봇이 세계 이벤트를 설명할 때 언어에 따라 정치적 답변이 달라질 수 있다는 연구 결과가 나왔습니다. 같은 질문을 영어와 러시아어로 하면 GPT, Claude, Gemini 등 AI 시스템의 대답이 다르게 나옵니다. 특히 공식 언어를 기준으로 그룹화하면, 러시아에 친화적인 답변이 더 많이 나오는 나라들이 러시아를 더 좋아하는 경향을 보입니다. 이 연구는 정보 전쟁이 AI 모델 학습 자료에 영향을 줄 수 있다는 것을 시사합니다.

핵심 보기
원문 보기
AI 심화

Reproducibility is not construct validity: LLM measurement of institutionally situated communication

전체 요약

연구자들은 AI 모델이 실제 의사소통을 정확하게 측정하는지 확인하기 위해 실험을 진행했습니다. 대화 내용을 자세히 분석한 결과, AI가 정확하게 이해하고 반영하지 못한다는 결론을 얻었습니다. 이 연구는 AI 기술의 한계를 보여주며, AI 모델이 실제 상황에서 얼마나 잘 작동하는지에 대한 의문을 제기합니다.

핵심 보기
원문 보기
AI 심화

What Do We Expect from LLMs? Mapping the Design of LLM Benchmarks

전체 요약

이 연구는 대형 언어 모델(LLM) 평가를 위한 다양한 테스트 방법을 분석합니다. 2022년부터 2026년까지의 1만 4,767편의 논문을 살펴보며, LLM들이 어떻게 평가되고 성공 기준이 바뀌는지 알아봅니다. 연구자들은 LLM들이 실제 업무에서 잘 수행할 수 있는 능력을 더 중요하게 생각하고 있습니다. 하지만 모델이 직접 만든 자료는 크게 늘지 않았습니다. 이 결과는 AI 테스트가 독립적인 증거를 제공하는 것인지, 아니면 모델의 선호도를 반영하는 것인지에 대한 질문을 던집니다.

핵심 보기
원문 보기