StateSight: Benchmark Testa Raciocínio Espacial em Modelos de IA Visual
Novo benchmark StateSight demonstra que modelos como GPT-5.5 e Claude Sonnet 5 ainda não dominam o raciocínio espacial, com humanos superando a IA em todas as três tarefas de reconstrução visual testadas.
