WEBVTT

00:00:00.199 --> 00:00:05.729
A IA nunca dorme, e esta semana tem sido absolutamente loucaaaa.

00:00:06.559 --> 00:00:48.979
Anthropic lança seu último modelo Claude, que você pode usar de graça. A OpenAI realizou o seu evento anual Dev Day esta semana com novos anúncios. O Google finalmente liberta o seu modelo de fronteira, Jeminái 4 Argon, e é uma besta absoluta. Temos alguns geradores super minúsculos de voz-texto que são apenas megabytes de tamanho, então isso pode facilmente caber em seu telefone ou outros dispositivos de borda. Não temos um, mas dois novos geradores e editores de imagens de última geração. Esta IA permite-lhe tirar uma imagem e controlar o caminho da câmara nesta cena. Robôs humanóides podem agora jogar badminton autonomamente. Temos uma tonelada de novos modelos de código aberto e muito mais. Então, vamos dar uma olhada.

00:00:48.979 --> 00:02:00.053
Primeiro, temos uma nova IA chamada InSpatial World 1.5. Isso pode basicamente pegar qualquer imagem mais um caminho da câmera e ele vai gerar um vídeo andando na cena através desse caminho da câmera. Agora eu a destaquei a versão 1 há algumas semanas, mas a versão 5 é ainda de melhor qualidade. E isso pode começar com apenas uma única imagem ou múltiplas imagens para dar-lhe ainda mais consistência e precisão. Ou você pode até mesmo inserir um panorama ou um vídeo completo. E se você inserir um vídeo, então ele também é capaz de capturar o movimento do vídeo original enquanto você caminha através da cena. Isto lhe dá o controle final de como quer ver a cena com base numa determinada trajetória da câmara. E é claro que você também pode como congelar o quadro a qualquer momento para fazer alguns efeitos de tempo de bala muito legais. Agora, no topo, eles já lançaram o código para isto. Então, se você clicar neste botão de código e você rolar para baixo um pouco aqui, ele contém todas as instruções sobre como baixar e executar isso. Note que isso é baseado em Wan 2.1. Me surpreende que não tenham usado o Minimax H3 para isto. Mas de qualquer forma, isso é baseado em Wan 1.3B e isso é apenas menos de 6GB de tamanho. Então você deve ser capaz de encaixar isso na maioria das GPU de consumo. Se você estiver interessado, eu vou deixar um link para esta página principal na descrição abaixo.

00:02:00.054 --> 00:03:15.258
Também nesta semana, temos uma nova IA chamada Sol Refiner pela NVIDIA, e isso pega um vídeo de baixa resolução e o amplia em um vídeo de alta resolução mais nítido até 4K em um único passo. Note que aqui, se você ampliar em seções específicas, é muito mais detalhado do que o vídeo original. O bom é que isso é modelo agnóstico, então você pode usar qualquer modelo de vídeo, incluindo o melhor OpenAI, Minimax H3. Então aqui estão alguns exemplos. Note que com o Sol Refiner, é muito mais afiado, mas tende a mudar alguns dos detalhes um pouco mais. Ou aqui está outro exemplo para sua referência. Note que os detalhes deste celeiro são ligeiramente diferentes depois de passar pelo refinador. Isto não é realmente fiel. Aqui está outro exemplo para sua referência. Mais uma vez, não totalmente fiel ao vídeo original. Então esse é o principal problema que eu tenho com isso. Em vez de Minimax H3, você também pode usar outro modelo de vídeo como KOSMOS da NVIDIA para Alibaba Wan. O bom é que já divulgaram isto. Então, no topo da página, se você clicar neste botão de código e você rolar para baixo um pouco aqui, ele contém todas as instruções sobre como executar isso localmente em seu computador. Note que isso é emprestado do refinador LTX, mas eles ajustaram-no para apenas fazer o upscaling em um passo. Se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.

00:03:15.259 --> 00:04:53.040
Também esta semana, temos um modelo super minúsculo de fala para texto. Em outras palavras, um modelo de transcrição de áudio. Acho que é a mais pequena que já vi até agora. Então isso é de apenas de 16.9 megabytes de tamanho. Tenha em mente que os outros são pelo menos vários gigabytes de tamanho, então isso é realmente pequeno. Agora, por causa de seu tamanho, isso pode ser executado em apenas uma CPU sem dependências. Nem sequer precisa de uma GPU para rodar isto. Na verdade, vamos testar isto agora mesmo. Então, vou falar e vamos vê-lo transcrever isto. Assim, isso pode transcrever até 30 segundos de áudio e pode detectar automaticamente o idioma e também dar os tempos para cada palavra. Certo, então depois, aqui está a transcrição do que eu acabei de dizer. Então, como eu disse, você pode inserir até 30 segundos em uma passagem e suporta todas esses idiomas que são automaticamente detectadas. Não é mostrado nesta demonstração, mas você também pode fazê-lo dar-lhe as datas para o início e o fim de cada palavra. E olha para a velocidade insana disto. Porque é tão pequeno, também é muito mais rápido na transcrição em comparação com a base Whisper. Ele também decodifica como 6 vezes mais rápido. Aqui está a taxa de erro entre Whistle e Whisper Base e outro modelo de transcrição minúsculo. Você pode ver pelo menos para alguns destes benchmarks, ele tem uma taxa de erro menor em comparação com Whisper Base. Agora, na parte inferior desta página, contém as instruções sobre como instalar e executar isso localmente em seu computador. É apenas um comando de instalação pip muito simples. Além disso, os modelos estão no Hugging Face. Este é o menor modelo de transcrição que já vi até agora. Então você pode até usar isso em dispositivos realmente pequenos, como telefones ou outros dispositivos de borda que não têm GPU. Se você estiver interessado, eu vou deixar um link para esta página na descrição abaixo.

00:04:53.041 --> 00:05:39.409
Esse não foi o único modelo de fala para texto que temos esta semana. Então aqui está outro chamado phonon2. Isto é um pouco maior, então é menos de 900 megabytes, que ainda é muito pequeno em comparação com outros modelos TTS que são pelo menos gigabytes de tamanho. Então aqui diz que isso pode transformar uma hora de áudio em texto em cerca de 20 segundos. A coisa boa é que este é de código aberto, além de que também existem alguns espaços no Hugging Face gratuitos para você experimentar isso online. Então aqui está um exemplo de eu usar isso agora. E como podem ver, aqui está a transcrição. Agora, se você olhar para estes benchmarks, ele ainda funciona muito bem em comparação com outros modelos que são muito maiores. Em média, ele recebe a segunda menor taxa de erro. Então, na parte inferior, eles lançaram o modelo para você baixar. Se você estiver interessado em ler mais, eu vou deixar link para esta página principal na descrição abaixo.

00:05:39.579 --> 00:07:22.079
Agora, no início desta semana, o Anthropic deixa cair o seu último modelo, Claude Sonnet 5.5. Agora, Sonnet é o seu modelo menor, enquanto Opus é o modelo maior, mais inteligente, mas este novo Sonnet 5.5 perfura bem acima do seu peso. Se você comparar isso com a versão anterior do Sonnet, ele tem melhorias massivas sobre uma tonelada de diferentes tarefas de codificação e conhecimento. E até marca muito perto de Opus 5.5. Aqui está a sua pontuação TerminalBench para referência. Agora, mesmo que Sonnet 5.5 é um modelo menor, não é necessariamente mais barato de rodar. Falaremos mais sobre isso num segundo. E então aqui está outro gráfico mostrando Sonnet 5.5 através da linha azul. E como você pode ver, isso é inteligência ligeiramente inferior ao Opus 5.5, e não é necessariamente mais barato. Aqui estão outras fichas. Se você olhar para este índice de inteligência por Análise Artificial, então a coisa impressionante é Sonnet 5.5 é o número 2, mesmo batendo GPT-6 Astra. Mas como você pode ver aqui, porque é um pouco mais burro do que Opus 5.5, a quantidade de tokens ou custo que leva para completar uma tarefa é na verdade ainda maior do que Claude Fêibol ou Claude Opus. Na verdade, aqui eles classificaram-no como o modelo mais caro disponível para completar uma determinada tarefa. E uma das razões é que ele tende a produzir a maioria dos tokens de saída por tarefa em comparação com qualquer outro modelo. Então, honestamente, não é muito impressionante em termos de eficiência. Se quiser a melhor informação, eu iria com o Opus ou a Fêibol. Se você quer o melhor desempenho por custo, então eu iria com o muito mais barato GPT-6.1 Sol ou GPT-6 Astra. Mas a coisa boa sobre este novo modelo Sonnet 5.5 é que agora é o modelo padrão no plano livre. Se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.

00:07:22.119 --> 00:09:14.749
Também nesta semana, o OpenAI realizou seu evento anual Dev Day com algumas atualizações notáveis. Então, vamos rever os principais. Agora, um dos principais anúncios do OpenAI Dev Day é o seu novo produto Dots. Isso é basicamente como um agente de IA persistente que tem seu próprio computador e pode continuar funcionando mesmo quando você não está conversando ativamente com ele. Assim, ao contrário de um chatbot normal, onde você apenas dá um prompt e espera por uma resposta, um DOT tem seu próprio computador em nuvem e navegador para que ele possa se conectar a milhares de aplicativos através de plugins. Ele pode continuar trabalhando para o seu objetivo 24 por 7. Assim, você pode ter um continuamente observando feedback do cliente, corrigindo bugs, testando as mudanças e preparando pedidos de pull enquanto você trabalha em outra coisa. Seu dot pode simplesmente pegar um projeto e correr com ele mesmo enquanto ele está trabalhando em outros projetos. Então você pode apenas dar-lhe novas tarefas e novos projetos sem ter que girar para cima tópicos separados. E pontos podem funcionar em ChatGPT, Slack e Teams. Então você pode até conversar com ele no seu telefone ou em qualquer outro dispositivo. E se isso soa familiar para você, bem, é basicamente como OpenClaw, mas aqui OpenAI apenas embrulhou em um produto de consumo muito mais fácil de usar. E a propósito, isso também é o que Meta está fazendo com Muse e Groq com GroqBot. Aqui eles dizem que os Dots estão sendo lançados hoje para usuários Pro e Business Premium em mercados elegíveis. Em outras palavras, não na União Europeia. Então, se você está em um desses planos, então no menu esquerdo do ChatGPT, você deve ver seu Dot aqui. Note que você pode ligar para seu Dot ou apenas enviar uma mensagem no Slack, e ele tem um computador de nuvem que está sempre ligado. E aqui eles dizem que Dots é alimentado por GPT-6 Astra. Agora a coisa boa sobre o estado atual de IA é que você pode apenas dar-lhe qualquer produto e fazê-lo vibe clonar o produto em uma questão de horas. Então, literalmente apenas algumas horas após o OpenAI lançar DOTS, já temos uma alternativa aberta chamada OpenDots.

00:09:14.749 --> 00:10:16.269
Então esta é uma alternativa de código aberto que você pode self-host e você pode ligá-lo a qualquer modelo ou até mesmo executar o modelo localmente se você tiver hardware suficiente. Portanto, esta é basicamente uma alternativa para os DOTS ou Menomuse, Grokbot, etc. Então, se você estiver interessado em uma opção aberta e local, nesta página ela contém todas as instruções sobre como baixar e executar isso localmente. É claro que isto é apenas uma estrutura e você ainda deve ligar o seu próprio LLM a isso. Então esse é um exemplo de código aberto. Temos ainda outro que também foi lançado pouco depois do lançamento do OpenAI, e este também é chamado OpenDots. É o nome exato como a ferramenta anterior, e como o nome implica, esta também é uma alternativa de Dots de código aberto. Então você pode se auto-apresentar isso e você pode atribuir agentes para fazer várias coisas. E assim como os Dots do OpenAI, você também pode enviar SMS ou ligar para um Ponto e dar instruções sobre o que fazer. Ou também pode localizá-los no Slack. Então é basicamente a mesma coisa que OpenAI Dots, mas apenas código aberto. Se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.

00:10:16.489 --> 00:12:20.459
Agora, além do Dots, o OpenAI também lança o GPT-6.1 Sol esta semana. Esta é uma versão atualizada do GPT-6 Sol, que só foi lançada na semana passada. Então, agora estamos recebendo upgrades de modelos em apenas uma semana em vez de meses. E aqui eles afirmam que este novo 6.1 Sol está perto da inteligência Astra por um quinto do preço. Se olharmos para vários benchmarks de codificação de agentes como DeepSWE, você pode ver que o GPT-6.1 Sol é muito mais eficiente. Então o eixo x é custo por tarefa. Idealmente, você quer estar no canto superior esquerdo. O mesmo com a Automation Bench. Você pode ver que é muito mais eficiente e apenas um pouco menos inteligente do que GPT-6 Astra, que é a linha azul. Aqui está o teste de benchmark como é bom em operar diferentes interfaces. E como podem ver, novamente, o GPT-6.1 é muito mais eficiente. E então aqui está o benchmark em suas capacidades de pesquisa científica. Agora, se você olhar para este avaliador independente, Artificial Analysis, você pode ver que GPT-6.1 é apenas 1 ponto menos inteligente do que GPT-6 Astra, definitivamente entre os modelos de fronteira lá fora. E se você olhar para o custo por tarefa, você pode ver que é muito mais barato do que GPT-6 Astra e os modelos caríssimos Claude. Então este é definitivamente o modelo de fronteira mais eficiente em termos de custo lá fora. Agora, no fundo, diz GPT-6.1 Sol está disponível hoje para todos os planos pagos no GPT Work e Codex. Ainda não está disponível no Chat. Então, se você está em um plano pago, então se você clicar nesta guia Trabalho, você deve ser capaz de acessar 6.1 Sol aqui. Agora é o seguinte, enquanto este novo GPT-6.1 Sol é muito mais barato, uma das outras atualizações do OpenAI que é fácil de perder é isso. Então basicamente para o plano Pro de $200, em vez de ter 20 vezes mais uso comparado ao plano Plus mais barato, em breve eles vão reduzi-lo para apenas 10 vezes mais uso. Basicamente, seu uso é reduzido em metade. E a propósito, eles também estão introduzindo um novo plano que vai custar $500, o que vai dar-lhe ainda mais uso. Se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.

00:13:48.629 --> 00:15:02.889
Também nesta semana, temos uma nova atualização da ComfyUI. Se você ainda não ouviu falar de ComfyUI, esta é uma das interfaces mais populares para executar modelos de imagem, vídeo e áudio localmente. Mas à primeira vista, esta interface parece super complicada, certo? Com uma tonelada de nós e macarrão, e às vezes é uma dor de usar. Bem, esta semana introduziram algo chamado Agente ComfyUI. É basicamente um agente construído na ComfyUI, então você pode apenas promovê-lo sobre o que você quer e ele vai planejar os passos. Ele criará e conectará os nós e executará o fluxo de trabalho para que você não tenha que manualmente arrastar e soltar nós e linhas você mesmo. Acho que isto é especialmente útil para coisas técnicas. Então, se você ficar preso em alguma coisa, se você clicar em uma mensagem de erro, então você pode apenas pedir a este agente dentro da ComfyUI para, com sorte, corrigi-lo autonomamente para você, ou ele pode apenas criar ou editar automaticamente um fluxo de trabalho para você e também executar o fluxo de trabalho. Então você pode apenas pedir para, por exemplo, gerar um vídeo usando o Minimax, e ele pode automaticamente escolher o fluxo de trabalho certo e executá-lo para você. Agora, atualmente isso está disponível na Comfy Cloud, que é seu serviço online pago, mas eles também adicionarão esse recurso de agente ao Comfy Desktop em algumas semanas. Por isso, fique ligado. Se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.

00:15:02.949 --> 00:16:18.689
Também esta semana, temos uma nova IA chamada Pixel UMM. Este é um modelo que pode entender e gerar imagens e vídeos. Mas aqui está a parte interessante. Não usa um descodificador. Ele funciona diretamente no espaço de pixels em vez de usar um codificador. Se você não tem idéia do que estou falando, basicamente para a maioria dos modelos de imagem e vídeo, eles realmente geram o conteúdo no que é chamado de espaço latente. Esta é uma dimensão matemática mais condensada que torna mais fácil de trabalhar. E então ele conecta-o através do que é chamado um componente codificador para basicamente converter isso em espaço pixel, que você e eu podemos ver. Agora o interessante sobre Pixel UMM é que ele simplesmente remove completamente este passo. Em vez disso, faz a geração no espaço de pixels, que você e eu podemos ver. Então aqui estão alguns exemplos de suas gerações para sua referência. Eu diria que a qualidade e consistência não são tão boas quanto os modelos de fronteira lá fora, mas nóte que isso é apenas uma prévia de pesquisa de uma nova arquitetura. No topo, eles lançaram o código e o modelo para isso. Então, se você clicar neste link e você rolar para baixo um pouco aqui, ele contém todas as instruções sobre como baixar e executar isso localmente em seu computador. E nóite que a maioria dos arquivos fonte estão sob a licença Apache 2, que é muito permissiva. Se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.

00:16:18.999 --> 00:17:33.529
Também nesta semana, temos um novo modelo de imagem chamado Ideogram 4.5, e isso é o que eles chamam de modelo de edição mais preciso de sempre. E como você pode ver a partir destes exemplos, você é capaz de editar imagens existentes com linguagem natural, e ele só vai editar partes específicas da imagem, mantendo o resto da imagem o nível de pixel Como ele é consistente. Na verdade, se você comparar Ideogram 4.5 com outros modelos de imagem como GPT Image ou Nanobanana, você pode ver que após uma tonelada de edições diferentes, os outros concorrentes apenas começam a introduzir uma tonelada de ruído na imagem. A imagem distorce bastante, mas com o Ideogram, ela permanece super consistente mesmo em todas essas edições. A coisa legal com Ideogram, como com a versão anterior 4, é que você pode desenhar caixas delimitadoras através da tela para determinar o que vai em que região. Então aqui está um exemplo onde podemos desenhar uma caixa limite aqui e só editar essa região mantendo o resto da imagem completamente igual a antes. Agora, atualmente você pode tentar Ideogram em sua plataforma on-line, mas eles também estão planejando abrir Ideogram 4.5 para que você possa executar isso localmente, o que é fantástico. Eu acho que uma vez que eles abrirem isso, ele será o melhor editor de imagens local. Se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.

00:17:33.539 --> 00:19:03.459
Agora, além do Ideogram 4.5, temos mais um novo modelo de imagem esta semana chamado Flux3Image. Agora, isto também tem uma tonelada de características muito legais. Assim como o Ideogram V4, você pode desenhar caixas delimitadoras através de sua tela e descrever o que vai em cada lugar. Então isso permite que você tenha controle granular sobre a composição da imagem, como você pode ver a partir destes exemplos. Não precisa usar estas caixas. Você pode apenas usar um prompt de texto regular para gerar uma imagem. E isso também é super versátil. Isso pode lidar com uma tonelada de imagens diferentes, incluindo fotos realistas ou cartazes com uma tonelada de diferentes elementos e texto. Isso também pode fazer referência à imagem, para que você possa conectar até 10 imagens de referência para que ela use em sua geração, como você pode ver aqui. Então uma ferramenta muito flexível. E, claro, isso também pode editar imagens com linguagem natural, então você pode tirar qualquer foto e adicionar ou remover ou substituir objetos ou alterar a cor das coisas ou escalar uma imagem, colorir uma foto em preto e branco, e outros casos de uso. Agora, atualmente, este é de código fechado, mas você pode tentar usando sua plataforma online. Eles afirmam que vão abrir o código-fonte dos pesos para isso no futuro, o que é ótimo, mas nóte que eles também disseram isso para o vídeo FLUX-3, que já foi há meses, e ainda não há sinal de um modelo aberto. Por isso, até agora, não é um bom sinal. Espero que eles vão manter a sua palavra e abrir o código tanto FLUX-3 vídeo e FLUX-3 Imagem. Por enquanto, se você estiver interessado em ler mais, eu vou linkar para esta página na descrição abaixo.

00:19:03.459 --> 00:22:13.649
Também esta semana, o Google está finalmente de volta. Acabaram de revelar a Jeminái 4 Argon, o seu melhor e mais recente modelo. E esta coisa é uma besta absoluta. Assim, através de vários benchmarks sobre como agente decodificação e trabalho de conhecimento, ciência e matemática, uso de computador, etc., em média bate GPT-6 Astra, bem como os melhores modelos Claude. Se você olhar para este benchmark DeepSWE em decodificação de agente de longo horizonte, então você pode ver que Jeminái 4 é realmente classificado número 1. O mesmo com o índice VALS, que mede seu desempenho em um conjunto diversificado de tarefas de trabalho do conhecimento Jeminái ocupa o número 1. O mesmo acontece com a investigação e análise financeiras, bem como com o trabalho jurídico de longo horizonte. Agora, se você olhar para este comparativo independente por Análise Artificial, então você pode ver que Jeminái 4 não é classificado número 1, mas empatado para o segundo lugar com GPT-6 Astra e Claude Fêibol, ainda alguns pontos atrás Claude Opus 5.5. No entanto, se você olhar para o custo disso, então isso é muito mais barato do que os outros concorrentes que têm aproximadamente a mesma inteligência. Então isso é realmente muito eficiente em termos de custos. Agora o que eu acho que é a maior característica de Jeminái 4 Argon é que ele pode produzir 1 milhão de tokens. Isso é uma loucura. Para sua referência, outros modelos de fronteira só podem produzir tokens 64K para 128K. Isto é basicamente como quantas palavras ele pode produzir em sua resposta. E 1 milhão de tokens é como 700.000 palavras em apenas uma saída. A propósito, esta não é a janela de contexto ou a quantidade de informação que você pode divulgá-la. Todos os modelos Frontier já têm um milhão de token de janela de contexto, mas aqui estamos falando de algo completamente diferente, que é a sua saída tokens. Então imagine Jeminái 4 sendo capaz de apenas produzir um romance inteiro ou série de romances ou uma base de código inteira em apenas uma resposta. Isso é uma loucura. Outra coisa que eu acho super impressionante sobre Jeminái 4 Argon é que tem a menor taxa de alucinações oniscience em comparação com todos os outros modelos por aí. Ele só alucina 15% do tempo de acordo com este benchmark, enquanto os outros modelos como GPT-6 são 50%, e os modelos Claude estão todo o caminho até aqui em torno de 60 a 70%. Então, isto é super impressionante. Agora, uma ressalva a esta referência é basicamente medir quando um modelo falha em responder a uma pergunta, dá-lhe uma resposta errada ou uma resposta parcial ou admite que não sabe? Está bem, então não está acertando na resposta. É basicamente medir se ele não sabe a resposta, será que vai ser apenas honesto e dizer que não sabe em vez de inventar coisas. Assim, a partir deste gráfico, você pode tipo de ver Jeminái 4 como sendo o mais honesto se ele não sabe uma resposta. Agora, antes de ficar muito empolgado aqui, eles dizem que eles estão a lançar a Jeminái 4 Argon apenas para um conjunto de defensores cibernéticos de confiança através do seu programa privado. Então, plebeus como você e eu não teremos acesso a isto ainda. E uma vez que eles começarem a liberar, ele vai começar com clientes pagos API e Google AI Ultra assinantes. Portanto, isso provavelmente será pago e só disponível através do plano mais caro. Espero que eles liberem isso em breve para o público para que eu possa testar o inferno fora dele e ver como ele se compara com os outros modelos de ponta. Por enquanto, se você estiver interessado, eu vou deixar um link para esta página de lançamento principal na descrição abaixo.

00:22:13.819 --> 00:23:23.489
Também nesta semana, o ByteDance lança não uma, mas duas novas maneiras de acelerar a geração de vídeo e imagem. Assim, a primeira forma é chamada DMAD, que significa correspondência de distribuição como destilação Adversária. Então, como isso funciona é que agora você pode usar um modelo de vídeo como Minimax para gerar vídeos em apenas 4 passos em vez dos regulares 20 a 30 passos. Então aqui estão alguns exemplos de suas gerações com o modelo de 4 passos. Então aqui estão alguns outros exemplos adicionais para sua referência. Agora, a parte interessante é como eles treinaram isso. Então eles usaram o modelo base para treinar um novo modelo chamado Student sobre como gerar vídeos em apenas 4 etapas. E usa algo chamado cabeças discriminadoras para comparar as saídas do professor e as saídas do aluno. E então usa essas diferenças para descobrir como o aluno deve melhorar. E esta mesma arquitetura funciona não só na Minimax, mas também em outros modelos de vídeo e imagem. Agora, no topo da página, eles já lançaram isto. Então, se você clicar neste botão de código e você rolar para baixo um pouco aqui, ele contém todas as instruções sobre como executar isso localmente em seu computador. Então você vai precisar baixar o modelo Minimax base, mas então estes LoRAs são apenas 1,4 gigabytes cada.

00:23:23.594 --> 00:25:09.229
Esse não foi o único método de destilação de 4 passos do ByteDance esta semana. Então eles também lançaram outro chamado PDMD. Muito confuso porque o anterior também é 4-step. Agora, como o método anterior, este também permite que você gere vídeos em apenas 4 passos em vez dos 20 a 30 passos regulares exigidos do Minimax H3. E se você comparar isso com outros métodos de destilação, você pode ver que este novo PDMD na extrema direita tem um desempenho muito melhor em comparação com os outros métodos. Aqui estão alguns outros exemplos para sua referência. Você pode ver o movimento, os detalhes, e a consistência são muito melhores do que os outros métodos de destilação. Agora, como isso funciona também é bastante interessante. Então, para o método anterior, mencionamos que usamos um crítico para dizer as diferenças entre a geração do aluno e a geração do professor e então consertar essas partes. Bem, às vezes o crítico não é perfeito, por isso alguns dos seus próprios erros são passados para o aluno. E o que o PDMD faz é olhar para essa parte do sinal de treinamento que vem do erro crítico e projetar isso para longe. E como você pode ver a partir desses índices de qualidade de vídeo e áudio, em média, este PDMD funciona melhor do que outros métodos de destilação. Agora no topo aqui, eles lançaram o código e os modelos para isso. Então, se você clicar neste botão de código e você rolar para baixo um pouco aqui, ele contém todas as instruções sobre como baixar e executar isso você mesmo. Agora aqui eles realmente liberaram duas coisas diferentes. Lançaram um modelo de base modificado. Então é o modelo Minimax completo, que é 66GB, mas você pode apenas executar isso com 4 passos agora em vez de 20 passos. Agora, se isso é grande demaos para você, também lançaram um LoRA para isto. Então você pode usar um modelo Minimax quantizado menor e, em seguida, basta colocar este LoRA em cima. E este LoRA é apenas como 1.4GB. Se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.

00:25:09.609 --> 00:27:08.769
Também esta semana, temos um exemplo bem selvagem de IA sendo usada em física teórica real. Então isso tem a ver com plasma, que é basicamente um gás extremamente quente feito de partículas carregadas. Os reatores de fusão precisam de manter este plasma preso usando campos magnéticos. E um tipo de reator de fusão chamado estelador usa campos magnéticos tridimensionais muito complicados para fazer isso. Mas houve uma questão matemática que não foi resolvida na física do plasma desde 1967. Basicamente, os cientistas se perguntavam se o plasma poderia sentar-se em um arranjo perfeitamente estável e suave dentro de um campo magnético 3D, mesmo quando a pressão muda de lugar para lugar. E durante décadas, pensamos que isso só seria possível se o campo magnético tivesse certos tipos de simetria. Mas esta semana, não tínhamos um, mas dois jornais refutando isto. Aparentemente eles usaram GPT-6 Astra para encontrar dois exemplos diferentes mostrando que outras configurações incomuns de plasma podem existir onde eles ainda permanecem estáveis e suaves. E esta não é a primeira vez que a IA ajuda a resolver um problema que permanece por resolver durante décadas. Então, há algumas semanas atrás eu mencionei OpenAI ser capaz de resolver este problema Navier-Stokes Millennium Prize onde ele foi capaz de mostrar que um fluido sob esta condição onde ele espirala como este pode alcançar singularidade. Em outras palavras, a parte do meio, este vórtice, é capaz de se esticar em uma velocidade infinita, pelo menos por um curto período de tempo. Bem, esta semana a IA desprovou outro problema que tem sido pendurado por décadas, desta vez na física do plasma. E eu tenho certeza que mais desses problemas vão ser desprovidos ou resolvidos com a ajuda de IA, especialmente problemas que têm a ver com matemática pura. E uma vez que ele encontra a solução, é realmente fácil de verificar que a solução está realmente correta. Então, outro exemplo muito legal esta semana de IA ajudando pesquisadores a descobrir alguma nova matemática em um campo extremamente especializado de física. Se você estiver interessado, eu vou deixar um link para o GitHub de ambos os trabalhos na descrição abaixo.

00:27:08.829 --> 00:28:25.599
Também esta semana, temos um novo sistema de robôs chamado TactileStep. Isso basicamente dá aos robôs humanóides uma melhor sensação de toque através de seus pés. Veja, a maioria dos sistemas de caminhada de robôs se preocupam principalmente com se o robô pode atravessar o terreno com sucesso, mas às vezes isso ainda pode levar a algum comportamento indesejado, como bater os pés no chão ou pousar nas bordas ou ficar de pé com contato instável. Bem, para os humanos, podemos naturalmente sentir pressão debaixo dos pés e ajustar como pousamos. Então TactileStep tenta dar aos robôs algo similar. Os pesquisadores equiparam o robô com palmilhas sensíveis à pressão, e então treinaram o modelo do robô mais para entender onde e quão fortemente cada pé está tocando o chão. E depois de treinar este robô Unitree, ele foi capaz de pousar mais suavemente e criar suporte mais estável durante a aterrissagem. Assim, você pode ver nestas demos, ele é capaz de andar muito suavemente através de escadas, encostas, e plataformas, e, claro, chão plano. De fato, aqui eles relatam uma redução de quase 50% na força de toque de pico, bem como redução no ruído de impacto, e até 24% mais área de contato. Este sistema permite que os robôs caminhem mais estável e suavemente pelo terreno. Se você estiver interessado, eu vou deixar um link para esta página principal na descrição abaixo.

00:28:25.739 --> 00:29:40.699
Também esta semana, esta tem que ser uma das mais impressionantes demonstrações de robôs humanóides que já vi até agora. Assim, pesquisadores de Tsinghua e outras universidades treinaram agora um robô humanóide especificamente o Unitree G1, para jogar badminton autonomamente. Como você pode ver a partir desta demonstração, ele é capaz de fazer mãos dianteiras ou mesmo backhands e retornos de salto, e isso pode autonomamente se reunir contra o jogador humano para várias rodadas. Agora, badminton é um esporte extremamente difícil para robôs humanóides porque, bem, o vaivém move-se extremamente rapidamente e o robô só tem uma janela muito pequena para atingi-lo. Como, ele precisa fazer uma tonelada de tomada de decisão em poucos segundos, incluindo como coordenar suas pernas, como correr em direção ao ônibus espacial, e, em seguida, como também torcer seu tronco e balançar seu braço e a raquete para atingir o ônibus espacial na direção certa. O problema é que não há muitos dados de movimento humano de alta qualidade para treinar um robô em badminton, então os pesquisadores tiveram que tomar um número limitado de movimento de batida real e automaticamente transformá-los em diferentes variações de dados sintéticos. E então isso se torna o conjunto de dados que foi usado para treinar o robô. De qualquer forma, uma demonstração impressionante. Se você estiver interessado nos detalhes técnicos, eu vou linkar para esta página principal na descrição abaixo.

00:29:40.989 --> 00:30:00.819
Também esta semana, ElevenLabs acaba de lançar o seu último modelo de texto-para-fala, V4, e eles afirmam que este é o modelo de voz mais emotivo até agora. Na verdade, você pode fazer uma tonelada de coisas em seu prompt para personalizar a geração. Por exemplo, você pode adicionar meta tags em seu prompt que ditam a direção ou efeito de som ou tom que você deseja. Aqui estão alguns exemplos.

00:31:44.519 --> 00:32:10.029
Então modelo de voz muito versátil que permite que você polvilhe em meta tags ao longo da transcrição para controlar a geração como quiser. Agora, isso está disponível mesmo no plano grátis. Tens uns 10 mil créditos para começar. E pelo menos de acordo com esta tabela de classificação, então ElevenLabs V4 é o melhor modelo de texto para fala disponível agora. Então, definitivamente tente isso. Até está disponível no plano grátis. Se você estiver interessado, eu vou ligar para esta página principal na descrição abaixo.

00:32:10.119 --> 00:33:30.229
Também nesta semana, o GPT-6 Astra aparentemente ajudou a quebrar uma carta codificada de Napoleão, que se parece com esta, que está sem solução há cerca de 217 anos. Então essa pessoa chamada Carter Church começou com esta imagem de baixa resolução. Ele alimentou para Astra, que basicamente dividiu a imagem em fileiras, e foi capaz de reconhecer cerca de 1.300 unidades de cifras escritas à mão e então descobrir quais marcas de aparência ligeiramente diferentes eram na verdade o mesmo símbolo. Para sua referência, uma tabela publicada anteriormente apenas dava valores para 33 letras, cobrindo cerca de um terço da mensagem. A partir daí, o GPT construiu um solucionador que testou possíveis mapeamentos, perguntando se o texto resultante parecia o francês real. E depois de testar isso por algumas rodadas, ele eventualmente reconstruiu o resto da chave, que se parece com isso. Descobriu também que algumas letras representavam realmente palavras inteiras, em vez de apenas letras individuais. Então todo o processo levou cerca de 6 horas, mas eventualmente foi capaz de decodificar a carta inteira. E aqui está a resposta. Acontece que se trata de uma reunião militar ao General Marmont descrevendo as posições das tropas pouco antes da Áustria ir para a guerra com a França. Então, se você está interessado em história ou criptoanálise, aqui está uma leitura fascinante sobre como AI pode ajudar. Se você estiver interessado nos detalhes técnicos, eu vou linkar para esta página principal na descrição abaixo.

00:33:30.329 --> 00:34:27.559
Também esta semana, temos uma nova IA chamada PAMI. Então isso pega qualquer prompt de texto mais qualquer objeto, e ele pode produzir uma animação 3D de uma pessoa interagindo com esse objeto. Então ele pode fazer uma tonelada de coisas como pegar objetos ou movê-los, girá-los, etc. E como podem ver, a pessoa segura e move os objetos naturalmente. Você pode ver para os outros, as mãos não estão realmente tocando o objeto. Eles não estão propriamente ligados. Portanto, o PAMI parece muito mais realista. Agora é assim que funciona. Basicamente permite diferentes partes do corpo, como as mãos, pés e quadris, cada voto sobre onde o objeto deve se mover. Em seguida, gera uma interação áspera do seu texto, e um refinador limpa os pontos de contato para que as mãos realmente toquem corretamente o objeto. Agora, se você rolar para cima, eles lançaram um GitHub para isso, e aqui eles planejam liberar o modelo, então fique ligado para isso. Note que isso está sob a licença do MIT, que é muito permissiva. Se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.

00:34:27.749 --> 00:35:28.199
Também nesta semana, temos uma nova IA chamada Point2Part, e isso pega uma única imagem ou uma malha 3D como entrada, e você pode colocar um ponto em cada parte que você deseja separar. E então essa IA basicamente produz o objeto inteiro nessas partes separadas. Então aqui está um exemplo disso em ação. Como podem ver, pode pegar numa imagem ou numa malha e parti-la em partes separadas e limpas, as quais podem então explodir. Agora, como isto funciona é bastante interessante. Em vez de gerar cada parte por conta própria, ela decompõe toda a forma com base em seus prompts de ponto, de modo que as partes nunca se sobrepõem e nunca deixam lacunas. E se colocarmos estas partes juntas, elas formam o objecto completo como antes. E se você olhar para vários benchmarks em relação à qualidade da peça, você pode ver que este novo modelo em média até bate outras ferramentas de segmentação semelhantes. Agora no topo, eles lançaram um GitHub para isso, e aqui diz que eles planejam lançar os modelos, bem como o código de treinamento. Por isso, fica ligado para isso. Por enquanto, se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.

00:35:28.229 --> 00:36:28.609
Também nesta semana, temos uma tonelada de modelos de código aberto novos e notáveis de pequeno a médio porte. Então, deixe eu passar rápido através deles. O primeiro é chamado de AstraBrief por Allen AI. Isto é baseado no Qwen-38B. Então este é um modelo de parâmetro de 8 bilhões bem pequeno. E isto foi concebido para transformar a literatura científica em relatórios de pesquisa devidamente citados. Assim, a AstraBrief apenas leva em seu prompt mais artigos relevantes, e pode produzir um relatório inteiro citado em apenas um passo. Agora, como você pode ver a partir desses benchmarks na qualidade do relatório, você pode ver que ele funciona muito melhor do que apenas o modelo base Qwen 3, e ele borda muito perto de outro concorrente chamado DrTulu. Aqui estão algumas outras pontuações para a sua referência. O bom do Instituto Allen é que eles abrem tudo. Então aqui eles liberaram o modelo e os conjuntos de dados para isso. O modelo 8B completo é como 32GB de tamanho, então você ainda vai precisar de uma GPU high-end para executar isso. Mas se você tem o hardware, esta é uma opção local decente para gerar relatórios de pesquisa científica.

00:36:28.609 --> 00:37:50.939
Agora, além da AstaBrief, aqui está outro modelo lançado pelo Instituto Allen esta semana. Chama-se OmoCore-3, e este não é um novo chatbot. É um novo sistema de treinamento que eles estão usando para construir uma mistura de modelos de especialistas. Basicamente, uma mistura de modelos de especialistas é como uma equipe de IA especialistas trabalhando juntos, e quando você o usa, apenas alguns desses especialistas são ativos em um determinado momento. Então isso dá-lhe um modelo enorme sem pagar o custo total de computação de executar a coisa toda todas as vezes. O problema é que, uma vez que esses modelos ficam realmente grandes, mover dados entre centenas de GPU torna-se um grande gargalo. Então OML Core 3 é projetado para corrigir este problema. A solução principal era manter cada especialista em sua própria GPU e enviar o trabalho para ele em vez de mover repetidamente o próprio especialista, como enviar empregos para os trabalhadores que permanecem em suas tarefas. Eles também espalharam o modelo e seus dados de treinamento em GPUs para salvar memória e agruparam cálculos menores para que os chips pudessem funcionar de forma mais eficiente. E junto com este quadro, ele realmente fez treinamento como 2,7 vezes mais rápido em comparação com o seu sistema anterior. O bom é que eles abriram o código como fizeram isto. Então, se você estiver interessado, eles publicaram um relatório técnico, bem como este GitHub, que contém a documentação sobre como eles executaram isso. Então você pode inspecionar esses links aqui para aprender mais. Se você estiver interessado, eu vou deixar um link para esta página principal na descrição abaixo.

00:37:50.939 --> 00:38:34.539
Também nesta semana, temos outra IA chamada iQuest Q1, e este é um novo modelo agente para sistemas CLI, então ferramentas de linha de comando como Claude Code e Codex. O objetivo para este modelo é trabalhar através de longas tarefas de software, como inspecionar acordos, executar comandos, falhas de depuração, usar ferramentas, etc., e manter iterando até que a tarefa seja concluída. Agora, isto é bastante grande a 320 bilhões de parâmetros. Esta é uma mistura de modelos de especialistas, então apenas 15 bilhões de parâmetros são ativos quando você usá-lo. E como você pode ver a partir destes benchmarks, ele realmente executa muito bem dado o seu tamanho. Agora, no fundo, eles já lançaram o código para isto. Então, se você clicar neste link, ele contém todas as instruções sobre como baixar e executar isso. Se você estiver interessado, eu vou deixar um link para esta página na descrição abaixo.

00:38:34.539 --> 00:39:45.569
Também nesta semana, temos um novo modelo chamado A-REX-2, que é um modelo de parâmetros de 27 bilhões bem minúsculo baseado em Qwen, e tem um design muito interessante. Assim, em vez de tentar resolver um problema uma vez, aprende a melhorar repetidamente sua própria resposta. Basicamente, o modelo propõe uma solução. Em seguida, testa ou mede como funcionou bem. Olha para o feedback, descobre o que rodou mal, e depois tenta de novo. Então pense menos como fazer uma pergunta à IA uma vez e mais como dar várias rodadas para pensar e depurar seu próprio trabalho. Na verdade, AReX-2 foi treinado fortemente em tarefas de aprendizado de máquina e programação algorítmica, onde o resultado pode realmente ser verificado. E se você olhar para estes benchmarks, ele é capaz de até mesmo executar em par com modelos que são muito maiores. Também é super eficiente. Então, por exemplo, se você olhar para o seu desempenho versus o número de parâmetros, ele funciona ainda melhor do que Kimi-k3, GPT-3 ou GPT-5.6 SOL. O mesmo acontece com estes pontos de referência de investigação. O bom é que já divulgaram isto. Então, se você clicar neste link de modelos no topo, ele leva você para o seu Hugging Face, onde você pode baixar o modelo. Agora, com 27 bilhões de parâmetros, isso ainda é bastante grande em 55 gigabytes de tamanho. Se você estiver interessado, eu vou deixar um link para esta página na descrição abaixo.

00:39:45.699 --> 00:40:11.754
E isso resume todos os destaques da IA esta semana. Deixe-me saber nos comentários o que você pensa de tudo isso. Qual foi a sua notícia favorita e qual ferramenta você está mais ansioso para experimentar? Como sempre, estarei à procura das melhores notícias e ferramentas de IA para compartilhar com vocês. Então, se você gostou deste vídeo, lembre-se de dar um like, compartilhar, se inscrever e ficar ligado para obter mais conteúdo. Obrigado por assistir e vejo vocês na próxima.
