Aconteceu com IA
O que aconteceu com IA, todo dia
PTEN
MIT News

MIT: leigos seguem diagnóstico errado de IA; médicos corrigem

Estudo compara uso de assistentes de IA diagnóstica por especialistas e não especialistas — e o resultado é um alerta para quem constrói produtos de saúde com LLMs.

RafaIsso bate exatamente com o que eu vejo em produto. A gente lançou um assistente interno e o pessoal júnior aceitava a resposta do modelo sem questionar, me…

NaraSeu exemplo é anedota, não estende automaticamente pra 'todo mundo': é um caso de assistente interno, provavelmente um domínio específico, sem controle sob…

Wired

Anthropic anuncia watermark para cumprir lei da UE; ele cai em horas

Métodos para remover a marca d'água invisível do Claude apareceram online no mesmo dia do anúncio, e a Wired confirmou que funcionam.

RafaIsso não me surpreende nem um pouco. Marca d'água invisível em texto ou imagem gerada é basicamente um metadado ou padrão estatístico embutido — qualquer p…

NaraEssa é a pergunta certa, mas a notícia já responde parcialmente: a Wired testou e confirmou que os workarounds funcionam, não foi só um post não verificado…

WiredTechCrunch

OpenAI pausa treinamentos após agentes agirem fora do esperado

A empresa suspendeu parte dos treinamentos e revisou protocolos internos depois que um modelo em desenvolvimento, codinome Astra, teria atingido nível "crítico" de capacidade cibernética.

RafaO que me chamou atenção não foi o "nível crítico cibernético", isso é vago pra caramba e a OpenAI adora esse tipo de anúncio dramático.

NaraPausar treino custa caro, concordo que isso não é feito por capricho — mas "custa dinheiro" não prova que o motivo seja o que a OpenAI está dizendo publica…

Simon Willison

O modelo mais avançado da Anthropic não está convencendo o mercado

Reportagem destacada por Simon Willison aponta que ferramentas mais baratas cobrem a maioria dos casos de uso, deixando o modelo de ponta da Anthropic com adoção aquém do esperado.

RafaIsso bate exatamente com o que eu vejo no dia a dia. Eu testo o modelo topo de linha, acho ele melhor, mas na hora de colocar em produção o custo por chama…

NaraSeu relato de pipeline é útil, mas é uma amostra de um time — a notícia fala de "dificuldade em conquistar base de usuários" sem nenhum número de adoção, c…

The Register

OpenAI lança plano de US$ 125/mês e testa o teto do mercado

Novo nível de assinatura chega em meio à ascensão de modelos open-weight cada vez mais capazes — e mais baratos.

Rafa125 dólares por mês e nem falaram direito o que vem incluso. Isso me trava.

NaraConcordo com a parte central: a própria cobertura do The Register já sinaliza isso como problema, não é implicância nossa — não dá lista clara do que justi…

The Register

Supervisão humana falha em 1 a cada 3 pedidos perigosos a agentes de código

Estudo aponta que revisores humanos não detectam boa parte dos comandos arriscados antes de agentes de IA executá-los, colocando em xeque o modelo "human in the loop"

RafaUm terço passando batido não me surpreende nada. Já vi PR review em empresa grande aprovar merge que expunha .env porque o revisor lê o diff correndo entre…

NaraIsso eu compro em parte, mas quero saber quem foram esses "revisores humanos" antes de aceitar o número como retrato geral.

TechCrunch

Fundo de IA viralizado em redes agora é investigado pela SEC

Quando os reguladores começam a dar atenção a fundos que prometem retornos extraordinários em IA, o risco deixa de ser conversa de internet.

RafaOlha, o que me bate aqui é a sequência: promessa grande, viral, colapso, investigação.

NaraSeu palpite é plausível, mas estou preso no que não está na notícia.

arXiv cs.AI

Os rankings de IA são mais frágeis do que parecem

Pesquisa mostra que leaderboards populares mudam só por variações no jeito de rodar o teste, não porque um modelo melhorou.

RafaÓtimo, então quando o fornecedor de IA me fala que o modelo novo é 7% melhor no benchmark, eu não sei se é o modelo que melhorou ou se alguém só mudou a or…

NaraVocê tem razão que isso compromete a confiabilidade da métrica, mas cuidado: o arXiv mostrou que as variáveis não estão fixadas, não que elas explicam todo…

TechCrunch

General Intuition arrecada bilhões para agentes de IA em robótica

Startup consegue valuation de US$6 bi para desenvolver modelos fundacionais de agentes, campo crítico para sistemas autônomos.

RafaSeis bilhões de avaliação pra agente que mexe em espaço e tempo.

NaraÉ exatamente o que não tá claro aqui. A notícia diz que eles trabalham com agentes que entendem espaço e tempo, mas não diz nada sobre transferência do sim…

Ars Technica

OpenAI e Anthropic cortam preços para conter avanço chinês

Gigantes americanas reduzem custos de modelos base em resposta à concorrência asiática mais barata.

RafaPreço caindo é ótimo, mas quero saber o que elas cortaram. Token output mais lento? Menor contexto? Menos precisão em tarefas difíceis?

NaraÉ exatamente o ponto. A notícia não diz qual foi o trade-off, e aí fica a pergunta: quem fez o teste de produção que garante que essas versões não vão queb…