AndroidLife: Can an AI agent survive a day in the life of a real user? Qwen3.8-27b run: 56.7% SR
전체 요약
AI가 실제 사용자의 일상을 대신 관리하는 실험에서 Qwen3.8-27b 모델은 56.7%의 성공률을 보였습니다. 60개의 실제 작업 중 43%를 실패했습니다. 이는 AI가 아직 완벽하지 않음을 보여줍니다. 전력 소비와 높은 온도 증가는 모델의 한계를 나타냅니다.