최신 뉴스

전체 뉴스

가장 최근에 발행된 뉴스부터 확인하세요.

주제별로 좁혀보기
일반 기사
AI 심화

Reproducibility is not construct validity: LLM measurement of institutionally situated communication

전체 요약

연구자들은 AI 모델이 실제 의사소통을 정확하게 측정하는지 확인하기 위해 실험을 진행했습니다. 대화 내용을 자세히 분석한 결과, AI가 정확하게 이해하고 반영하지 못한다는 결론을 얻었습니다. 이 연구는 AI 기술의 한계를 보여주며, AI 모델이 실제 상황에서 얼마나 잘 작동하는지에 대한 의문을 제기합니다.

핵심 보기
원문 보기
AI 심화

What Do We Expect from LLMs? Mapping the Design of LLM Benchmarks

전체 요약

이 연구는 대형 언어 모델(LLM) 평가를 위한 다양한 테스트 방법을 분석합니다. 2022년부터 2026년까지의 1만 4,767편의 논문을 살펴보며, LLM들이 어떻게 평가되고 성공 기준이 바뀌는지 알아봅니다. 연구자들은 LLM들이 실제 업무에서 잘 수행할 수 있는 능력을 더 중요하게 생각하고 있습니다. 하지만 모델이 직접 만든 자료는 크게 늘지 않았습니다. 이 결과는 AI 테스트가 독립적인 증거를 제공하는 것인지, 아니면 모델의 선호도를 반영하는 것인지에 대한 질문을 던집니다.

핵심 보기
원문 보기
AI 심화

Contagion on the Trading Floor: How Adversarial Signals Spread in Multi-Agent Trading Systems

전체 요약

AI 트레이딩 시스템이 위험한 신호를 받아들이는 것을 연구했습니다. AI가 사회 미디어에서 정보를 받으면, 그 정보가 분석가에게 잘못된 영향을 줄 수 있다는 것입니다. 실험에서는 간단한 공격도 AI의 성능을 크게 떨어뜨릴 수 있음을 보여주었습니다.

핵심 보기
원문 보기
AI 심화

From "Who Is This User?" to "What Does This Purchase Mean?": A Deployed Pipeline for Semantic User Profiling at Bank Scale

전체 요약

이번 뉴스는 은행에서 사용자의 특성을 자동으로 분석하는 새로운 방법을 소개합니다. 과거 거래 기록을 바탕으로, AI가 자주 발생하는 거래 패턴을 찾아내고 그 특징을 정리합니다. 이 방식은 한 사람당 비용이 줄어들게 되어 많은 사용자를 처리할 수 있게 됩니다. 실제로 일본의 큰 은행에서 이 방법을 적용해 100만 명 이상의 사용자에 대한 분석을 훨씬 효율적으로 수행했습니다.

핵심 보기
원문 보기
AI 심화

The Inference Engineering Pareto Atlas: Which Optimizations Dominate the Cost, Quality, and Latency Frontier?

전체 요약

연구원들은 대형 언어 모델의 추론 최적화 방법을 분석하여 가장 효과적인 설정을 찾았습니다. Qwen2.5-7B-Instruct를 다양한 하드웨어와 조건에서 실험한 결과, 18개의 설정이 최적화 선에 도달했습니다. 이 연구는 AI 모델의 성능과 속도를 균형있게 높이는 방법을 알려줍니다.

핵심 보기
원문 보기
AI 심화

When to Call an LLM: A Confidence-Gated Hybrid for Cost-Effective Emotion Recognition in Conversational AI

전체 요약

이 기사는 대화 맥락 내에서 감정 인식(ERC)의 세 가지 방법을 비교하고, 가장 효과적인 방법을 제안합니다. 저작자는 저렴한 스택 엑스포네스와 오프더셰일 LLM 프롬프팅 사이에 신뢰도 기반 혼합 모델을 도입하여 비용 효율성을 높였습니다. 이 혼합 모델은 IEMOCAP 데이터셋에서 0.595의 F1 점수를 얻었으며, GPT-4o-mini와 같은 LLM만 사용한 경우보다 훨씬 낮은 비용과 초저지연으로 성능을 높였습니다. 이 혼합 모델은 대화 맥락 내에서 감정 변화를 효과적으로 감지하고 처리할 수 있어, 대량의 음성 데이터를 저렴한 방법으로 분석할 수 있게 해줍니다.

핵심 보기
원문 보기
AI 심화

NeMo Data Designer: An Extensible Framework for Multimodal Synthetic Data Generation

전체 요약

NeMo Data Designer는 오픈소스로 공개된 데이터 생성 프레임워크입니다. 다양한 유형의 데이터를 쉽게 만들 수 있게 도와줍니다. 사용자는 각 열을 정의하고, 프레임워크는 필요한 데이터를 생성합니다. 새로운 기능을 추가하기도 쉽습니다. 이 프레임워크는 실제 업무에서 잘 작동하는지 여러 사례를 통해 검증되었습니다.

핵심 보기
원문 보기
AI 심화

I built a native Vulkan training backend for 143 modern Transformer architectures — no CUDA or PyTorch required

전체 요약

저는 Hierarchos 아키텍처의 훈련 백엔드로 시작했지만, 이를 더 넓은 프로젝트로 발전시켰습니다. 이 프로젝트는 Rust와 Vulkan을 사용한 143개의 Transformer 아키텍처에서의 훈련과 추론을 지원합니다. CUDA나 PyTorch를 필요로 하지 않으며, Vulkan을 기반으로 한 ML 훈련 스택이 가능해질 수 있는 방향성을 제시하고 있습니다. 그러나 아직 모든 모델 유형과 구성 요소가 검증되지 않았습니다. 이 프로젝트는 다양한 GPU와 호환성을 확보하기 위해 더 많은 테스트가 필요합니다.

핵심 보기
원문 보기