[Script Info]
; Script generated by pysubs2
; https://pypi.python.org/pypi/pysubs2
WrapStyle: 0
ScaledBorderAndShadow: yes
Collisions: Normal
ScriptType: v4.00+

[V4+ Styles]
Format: Name, Fontname, Fontsize, PrimaryColour, SecondaryColour, OutlineColour, BackColour, Bold, Italic, Underline, StrikeOut, ScaleX, ScaleY, Spacing, Angle, BorderStyle, Outline, Shadow, Alignment, MarginL, MarginR, MarginV, Encoding
Style: Default,Arial,20,&H00FFFFFF,&H000000FF,&H00000000,&H00000000,0,0,0,0,100,100,0,0,1,2,2,2,10,10,10,1
Style: A,Arial,20,&H00A52EFB,&H000000FF,&H00000000,&H00000000,0,0,0,0,100,100,0,0,1,2,2,2,10,10,10,1
Style: B,Arial,20,&H00DC9831,&H000000FF,&H00000000,&H00000000,0,0,0,0,100,100,0,0,1,2,2,2,10,10,10,1

[Events]
Format: Layer, Start, End, Style, Name, MarginL, MarginR, MarginV, Effect, Text
Dialogue: 0,0:00:00.34,0:00:06.01,A,A,0,0,0,,A IA nunca dorme, e esta semana tem sido absolutamente louca.
Dialogue: 0,0:00:06.52,0:00:48.30,A,A,0,0,0,,Seu waifu finalmente será entregue. Xiaomi lança seu mais recente e melhor modelo, MIMO 2.6. x.a.i. também lança seu melhor modelo, Grok 4.7. O OpenAI deixa cair o seu último modelo, GPT-6 Sol e Luna. E depois o Anthropic também lança o seu melhor e mais recente modelo, Opus 5.5. E logo depois, o Google também lança o seu último e melhor..., não importa, parece que eles só lançaram um modelo Flash texto-para-fala. Temos alguns novos geradores interativos de mundo que realmente permanecem consistentes o tempo todo. Flux libera um modelo de robótica aberta. Google compartilha seu plano de colocar data centers no espaço. Temos uma tonelada de novos modelos de código aberto e muito mais. Então, vamos car uma olhada.
Dialogue: 0,0:00:48.91,0:01:07.36,A,A,0,0,0,,Primeiro, temos um novo modelo de mundo interativo chamado World Crafter por Tencent. Como outros modelos mundiais, o World Crafter também permite que você crie basicamente um mundo 3D interativo com apenas um prompt de texto ou uma única imagem de referência. Agora, a parte inteligente é que ele implicitou memória 3D-consciente.
Dialogue: 0,0:01:07.52,0:01:25.42,A,A,0,0,0,,Então, mesmo que você olhe para o outro lado e olhe para trás, as coisas permanecem consistentes o tempo todo. E como isso funciona, além de apenas gerar o vídeo, ele também reconstrói uma nuvem de ponto 3D da cena para que as coisas permaneçam consistentes o tempo todo. É como se estivesse guardando um modelo 3D na memória.
Dialogue: 0,0:01:25.55,0:01:43.06,A,A,0,0,0,,Isto dá uma melhor compreensão e memória do que está realmente na cena. Então aqui estão alguns exemplos adicionais para referência. Você pode ver isso gerar mundos em uma tonelada de diferentes estilos artísticos. Você também pode controlar diferentes personagens. Pode ser primeira pessoa ou terceira pessoa. Esta é uma ferramenta muito flexível.
Dialogue: 0,0:01:43.23,0:02:09.14,A,A,0,0,0,,Agora, no topo da página, eles já lançaram isso. Então, se você clicar neste botão de código e você rolar para baixo um pouco aqui, ele contém todas as instruções sobre como baixar e executar isso localmente em seu computador. Note que eles lançaram dois modelos diferentes. Há um modelo base e um modelo rápido destilado. O tamanho do modelo é muito grande, por isso é cerca de 147 gigabytes para todos estes componentes. Se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.
Dialogue: 0,0:02:09.60,0:03:55.84,A,A,0,0,0,,Também nesta semana, temos um novo e super poderoso modelo de imagem chamado Ming Image 0.1. Este é um modelo aberto construído especificamente para design visual. Então este é um modelo de 6 bilhões de parâmetros texto-imagem para coisas como interfaces de usuário, infográficos, cartazes e outros desenhos visuais com uma tonelada de diferentes textos e elementos. Então aqui estão alguns exemplos impressionantes para sua referência. Ele suporta até resolução de 2K, e uma característica particularmente útil é que ele também pode gerar imagens com transparência. Em outras palavras, tem uma saída de canal alfa. Então você pode gerar um objeto ou elemento de design com um fundo transparente e, em seguida, adicionar o projeto em outro lugar. Então o modelo principal é chamado Ming Image 0.1 Design, mas eles também lançaram um segundo modelo chamado Ming Image Design Layer, que faz o oposto. Então, ele é destinado a pegar uma imagem de design plano completo e você iria pedir o modelo sobre o que você quer separar, e ele iria produzir várias camadas transparentes de coisas separadas, que você pode então editar individualmente. Então, uma ferramenta super poderosa. E você olha para este painel de design UI/UX pela Artificial Analysis, então, pelo menos em termos de modelos OpenWeights, você pode ver que Ming Image Design está atualmente classificado como número 1. Então, se você está procurando o melhor modelo aberto para gerar infográficos ou interfaces de usuário, diagramas diferentes, cartazes, ou basicamente qualquer coisa que contenha uma tonelada de elementos ou texto, então este pode ser o melhor modelo para usar. E o mais incrível é que isto está sob a licença do MIT, que é muito permissiva. Note que para o modelo base de design de imagem Ming que é 12GB de tamanho, isso deve ser capaz de caber na maioria das GPU de médio a alto nível. Agora, este modelo de camada de design, aqui é onde você pega uma imagem e a divide em camadas transparentes separadas. Este é um pouco maior a 24GB de tamanho. Se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.
Dialogue: 0,0:03:56.14,0:05:00.32,A,A,0,0,0,,Também esta semana temos um novo gerador de cena 3D chamado MiraScene. Isso é capaz de pegar qualquer imagem e reconstruí-la em uma cena 3D com objetos individuais separados. Então, como isso funciona é que você iria alimentá-lo com uma imagem e MirrorScene primeiro identifica os objetos na imagem e, em seguida, estima a profundidade da cena e, em seguida, gera a geometria 3D de cada objeto. Reconstrói então suas posições e tamanhos para que tudo se alinha com a imagem original. E isso é importante porque depois você pode então pegar a cena e editar objetos se você quiser, ou você também pode importar a cena no Blênder e animar objetos como este, ou você pode até mesmo conectá-lo em um simulador de física para treinar robôs como este. O mais incrível é que já liberaram tudo. Então, se você clicar neste botão de código e você rolar para baixo um pouco aqui, ele contém todas as instruções sobre como usar isso. Tudo tem 6,1GB de tamanho, por isso é bastante pequeno. Isto deve ser capaz de caber em GPU de consumo médio. Além disso, eles também lançaram o conjunto de dados para isso, o que é fantástico. Se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.
Dialogue: 0,0:05:00.32,0:06:41.54,A,A,0,0,0,,Também esta semana, temos um novo modelo robô chamado Flux 3 Action. Agora, no passado, a equipe Flux lançou uma tonelada de modelos de imagem e vídeo generativos. Então é interessante que eles estão tomando uma direção completamente diferente aqui e eles estão lançando um modelo de robô. Agora, como isso funciona é basicamente um modelo de ação mundial de 7 bilhões de parâmetros projetado para controlar robôs. Você daria um objetivo junto com informações visuais do que o robô pode ver usando suas câmeras e também informações sobre suas posições conjuntas. E o modelo pode prever tanto o que o robô deve fazer a seguir, como como o mundo ficaria depois dessa ação acontecer. Então, se você disser a um braço robô para colocar um objeto em outro lugar, Flux-3 Action pode olhar para a cena, prever uma sequência de comandos motores, e obter o robô para fazer esses comandos, e então olhar novamente e continuar corrigindo-se até que ele atinja o seu objetivo. Agora, o legal é que isso não precisa apenas controlar robôs, porque isso pode determinar que ação tomar e o que aconteceria a seguir. Você também pode fazê-lo jogar uma tonelada de jogos de vídeo como este. E como você pode ver, se você comparar Flux-3 Action contra outro modelo semelhante, Cosmos-3 Nano, não só é Flux-3, muito menor. Ele tem menos da metade dos parâmetros, mas também foi capaz de alcançar uma taxa de sucesso mais alta a uma velocidade muito mais rápida, tornando este super eficiente para a execução de robôs em tempo real. O mais incrível é que eles liberaram o modelo. Então, aqui, se você clicar em baixar os pesos e você rolar para baixo um pouco, aqui ele contém toda a documentação sobre como usá-lo, além de como afiná-lo em seu próprio robô ou jogo de vídeo ou outros dispositivos. E em 7 bilhões de parâmetros, o modelo base é bastante pequeno em apenas 14 gigabytes de tamanho. Se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.
Dialogue: 0,0:06:42.01,0:07:00.94,A,A,0,0,0,,Também nesta semana, o Google lança seu mais recente modelo de texto para fala, Jeminái 3.8 Flash TTS e Flash Lite TTS. A coisa incrível sobre este modelo TTS Jeminái é que você pode projetar uma voz completamente nova apenas descrevendo-o em um prompt de texto. Então aqui estão alguns exemplos. Aqui está uma voz de DJ de alta energia de Melbourne.
Dialogue: 0,0:07:20.72,0:07:22.39,A,A,0,0,0,,E aqui está um dragão japonês.
Dialogue: 0,0:07:53.03,0:08:04.31,A,A,0,0,0,,E a coisa boa sobre os modelos TTS Jeminái é que eles permitem que você adicione meta tags dentro da transcrição para que você possa criar algumas gerações realmente naturais e expressivas. Aqui estão alguns exemplos.
Dialogue: 0,0:08:27.79,0:08:35.85,A,A,0,0,0,,Ou aqui está outro exemplo onde você pode descrever exatamente como você quer que a transcrição seja lida dentro de meta tags, dando-lhe realmente controle granular.
Dialogue: 0,0:09:28.09,0:10:42.02,A,A,0,0,0,,Agora aqui eles lançaram dois modelos diferentes. Há o Flash TTS principal, e depois há também um Flash Lite TTS, e este é construído para uma escala de alto volume eficiente em termos de custos. Então, se você precisa fazer uma tonelada de dublagem ou criar uma tonelada de conteúdo de áudio. Aqui diz que isso suporta mais de 100 línguas e dialetos. E se você olhar para estes benchmarks em termos de qualidade de texto para fala, então estes novos modelos Jeminái são de última geração. Em média, eles até batem o Eleven-Labs. E então, em termos de design de voz, novamente, isso é como criar uma voz completamente nova a partir de um prompt de texto. Isso também é muito melhor do que outros modelos de design de voz. Se você olhar para esta tabela de classificação Voice Arena onde as pessoas podem testar diferentes modelos de IA, então você pode ver que este novo Jeminái 3.8 Flash está em segundo lugar. Em termos de robustez da pronúncia, então você pode ver que Jeminái 3.8 Flash é o líder atual. Agora dada a sua qualidade, isto também é incrivelmente barato. Este novo Jeminái 3.8 Flash está localizado aqui em termos de preços, tornando-o muito acessível. Agora isso já está disponível através da API e do A.I. Studio do Google, que você pode experimentar de graça. E também está disponível no Jeminái Notebook, que foi anteriormente chamado NotebookLM. Definitivamente um dos melhores e mais baratos modelos de texto para fala que você pode usar agora. Se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.
Dialogue: 0,0:10:42.59,0:12:38.40,A,A,0,0,0,,Na semana passada, mostrei-lhe este painel onde Xiaomi compartilhou o seu processo de aprendizagem de reforço para o seu próximo modelo, MIMO 2.6, em tempo real. Então você pode ver os treinos e o progresso do modelo aqui. Bem, eles acabaram de terminar o treinamento e esta semana eles lançaram o modelo MIMO 2.6 e seus resultados são muito avançados em termos de modelos de pesos abertos. Você pode ver para DeepSWE, o modelo Pro está muito perto de GPT-6 Astra, e ele até bate Fêibol-5. Para esses outros benchmarks de trabalho de agentes e conhecimentos, você pode ver que também é muito perto da Frontier. O resultado mais louco aqui é o Cyber Gym, onde alcançou mais de 95%, muito mais alto do que os outros modelos abertos Frontier. É super capaz de codificar diferentes ambientes e jogos 3D, como você pode ver a partir destes exemplos. Se você olhar para este índice de inteligência por Artificial Analysis, então você pode ver que MIMO 2.6 Pro é agora o modelo aberto líder lá fora, batendo o líder anterior GLM 5.3 por apenas 1 ponto. O custo também é ridiculamente barato. Então MIMO 2.6 é todo o caminho até aqui, custando apenas $0.13 por tarefa, ainda mais barato do que GLM 5.3 Flash, bem como o mais recente DeepSik 4.1 Flash. Na verdade, esta é basicamente a nova fronteira em termos de custo-eficácia. O mais incrível é que eles liberaram tudo. Então, se você clicar neste link do Hugging Face, aqui estão todos os modelos para você baixar. Note que o modelo Pro é um trilhão de parâmetros, então isso é bastante grande, como esperado de um modelo de ponta. E o tamanho total disto é de cerca de 573 gigabytes. O modelo Flash é um pouco menor em apenas 311 bilhões de parâmetros, e isso é apenas 178 gigabytes. Agora, além desses dois modelos MIMO, eles também lançaram MIMO Desktop, que é como o aplicativo de desktop ou arnês que usa MIMO. É como o Codex para o GPT ou o Claude Code para o Claude. Se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.
Dialogue: 0,0:12:39.02,0:13:56.61,A,A,0,0,0,,Também nesta semana, um dos outros laboratórios de IA principais na China chamado StepFun libera seu mais recente modelo, Step5 Preview. Este também é um agente multimodal incrivelmente poderoso. Então, isso tem 600 bilhões de parâmetros totais. Esta é uma mistura de modelos especialistas. Assim, quando você o usa, apenas 27 bilhões de parâmetros estão ativos. E como a maioria dos modelos Frontier, isso suporta uma janela de contexto de 1 milhão de tokens. De sua pontuação DeepSWE, você pode ver que isso é muito bom. O mesmo acontece com esses outros benchmarks de trabalho de codificação e conhecimento. Parece estar em par com ou até melhor do que os outros modelos de ponta abertos como GLM 5.3 e KimiK3. Se você olhar para este leaderboard por análise artificial, então você pode ver que o Step5 ainda está 1 ponto atrás do GLM 5.3, mas é quase 3 vezes mais barato do que o GLM 5.3 e também muito mais barato do que os modelos fechados porque ele também pode entender informações visuais, você pode chegar a código e uma tonelada de coisas muito bem. Por exemplo, eu posso inserir esta foto e fazê-la renderizar isso em 3D. Também é ótimo em pesquisas financeiras, como você pode ver a partir desses benchmarks. Agora, se você rolar até o fundo aqui, diz que o Step5 está disponível através de seus produtos e API, e o modelo será lançado em 15 de outubro. Por isso, fique ligado para isso. Se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.
Dialogue: 0,0:15:14.37,0:16:24.55,A,A,0,0,0,,Também nesta semana, temos outra IA chamada GAE, que significa Autoencoder Nativo Geometria. Isso é basicamente capaz de gerar um mundo 3D, o que é muito mais consistente porque como você pode ver aqui, não só gera apenas o vídeo da cena, mas também gera um mapa de profundidade mais a trajetória da câmera através do espaço 3D. Além disso, ele também reconstrói um modelo 3D da cena à medida que a câmera se move para que ela possa manter a cena consistente em sua memória. Então aqui está outro exemplo onde à esquerda você pode vê-lo gerando o vídeo, mas como ele está gerando o vídeo, ele também está gerando a trajetória da câmera e está reconstruindo toda a cena 3D. Agora, isso funciona com uma tonelada de diferentes ambientes e personagens. Como você pode ver a partir deste exemplo, pode ser a primeira pessoa ou a terceira pessoa. O mais incrível é que eles já lançaram isto. Então, se você clicar neste botão de código e você rolar para baixo um pouco aqui, ele contém todas as instruções sobre como baixar e executar isso localmente em seu computador. Note que os pesos são bastante pequenos. Tudo tem menos de 12 gigabytes de tamanho, então você deve ser capaz de usar isso na maioria das GPU de consumo médio. Eles também lançaram o roteiro de treinamento e avaliação para isso, o que é fantástico. Se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.
Dialogue: 0,0:16:24.87,0:17:40.83,A,A,0,0,0,,Na semana passada, a Meta lançou uma coisa chamada Muse, que é como um agente pessoal de IA. Você pode falar com ele como um chatbot e ele pode autonomamente fazer tarefas para você, como resumir seus e-mails ou fazer compras para você ou reservar coisas para o seu calendário, escrever respostas, etc. É como a OpenClaw, mas a Meta envolveu-a num produto muito mais fácil de usar. Não sei quanto a você, mas estou desconfiado em dar à Meta as minhas informações pessoais. Então, em vez de Muse, Na verdade, esta semana temos uma alternativa de código aberto chamada OpenMuse. É basicamente a mesma coisa. Isto é como um agente pessoal com um navegador e terminal e arquivos, e você pode apenas dar-lhe qualquer tarefa e ele pode continuar trabalhando por um longo tempo até que ele atinge o seu objetivo. Você pode conectá-lo ao Gmail ou Google Calendar ou outros aplicativos. Então isso também pode ajudá-lo a ler e resumir seus e-mails ou rascunho de respostas ou reuniões de livros para você em seu calendário, etc. Então nesta página, contém todas as instruções sobre como começar. Agora, este é um framework agente, então você pode realmente usar qualquer modelo que quiser. Claro, você pode emparelhar isso com um modelo local se você tiver computação suficiente, ou se não, você também pode vincular a um modelo pago através de uma chave de API. E o mais incrível é que isto está sob a licença do MIT, que é muito permissiva. Então, se você está procurando uma alternativa de código aberto para o Muse da Meta, aqui está uma boa ferramenta para verificar. Vou deixar um link na descrição abaixo.
Dialogue: 0,0:17:40.99,0:19:27.83,A,A,0,0,0,,Agora, eu acho que foi na semana passada que tivemos este novo tipo de modelo chamado Jev, que usa algo chamado Sistema 1 Thinking, o que faz decisões muito rápidas e rápidas. Isso é diferente do pensamento do Sistema 2, que é mais deliberado, de mais profundo raciocínio. E isso permite que ele responda perguntas muito rápido. Bem, esta semana temos uma alternativa ainda melhor e mais rápida, que é de código aberto. Então é chamado de Modelos de Linguagem Contrastiva, ou CLM para abreviar. Este também é um modelo ultra-rápido do sistema um, mas é treinado com algo chamado objetivos de aprendizagem contrastantes que conecta estados e ações. É basicamente a mesma coisa que o JEVS. Então pense nisso como como dar à IA a situação atual e um menu de coisas possíveis que ele poderia fazer em seguida. CLM olha para todos eles e, em seguida, imediatamente pontua qual ação melhor corresponde à situação. Basicamente dá-lhe uma confiança ou pontuação de probabilidade para cada opção. Agora eles construíram isto em torno do Qwen-38B de código aberto. Este é um modelo relativamente pequeno com apenas 8 bilhões de parâmetros, mas como você pode ver, isso é 9 vezes mais rápido do que Jev enquanto combina seu desempenho na maior parte do tempo. Então aqui estão alguns exemplos deste novo modelo CLM jogando Dino Run versus Jev na parte inferior. O interessante é que para a maioria dos jogos de vídeo, é só olhar para o estado atual em que você está e depois descobrir a melhor ação a seguir. Então o sistema 1 realmente funciona muito bem. Não precisamos de um modelo de IA para fazer raciocínios muito longos e profundos a menos que estejamos jogando um jogo estratégico como o xadrez. Agora nesta página, eles revelaram muitos detalhes técnicos sobre como isso funciona, incluindo o algoritmo de treinamento, a receita de dados, etc., incluindo todas as etapas do treinamento. Então isso é totalmente de código aberto. E na parte inferior, se você clicar neste repo GitHub aqui, ele contém todas as instruções sobre como baixar e executar isso localmente em seu computador. Se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.
Dialogue: 0,0:19:28.07,0:21:05.92,A,A,0,0,0,,Agora, no início desta semana, o x.A.I. lança seu mais recente e melhor modelo, Grok 4.7. Como você pode ver da linha branca, enquanto não corresponde ao desempenho ou inteligência de outros modelos de fronteira como Fêibol ou Opus, Grok 4.7 é capaz de fazer as coisas a um custo muito mais barato. Aqui estão alguns pontos de referência para sua referência, onde você pode ver que Grok 4.7 é muito mais barato do que os outros modelos. Aqui estão alguns benchmarks adicionais para sua referência. Assim, em termos de PIB-VAL, que mede o desempenho de uma IA no trabalho de conhecimento profissional. Você pode ver que ele até bate GPT-6 Astra, e é apenas alguns pontos abaixo de Fêibol 5.1. Aqui está outro parâmetro de referência que testa seu desempenho em trabalho de escritório multi-hora. E aqui está a engenharia elétrica. Agora, esses são apenas os seus parâmetros de auto-relato. Então vamos olhar para um avaliador independente chamado Artificial Analysis em vez disso. Se você olhar para o índice de inteligência deles, então infelizmente isso ainda está por trás do GPT-6, bem como o último modelo do Claude. E isso é na verdade apenas ligado com o melhor modelo de código aberto, MIMO 2.6 Pro. Em termos de inteligência, não é assim tão impressionante. E curiosamente, se olharmos para o custo por tarefa, pelo menos de acordo com a Artificial Analysis, isso custa mais do que o GPT-6, o que é meio chocante. Então eu realmente não vejo como isso é mais eficiente em termos de custo em comparação com os outros modelos de ponta. Mais uma vez, aqui está um gráfico mostrando inteligência versus custo. E como você pode ver, Grok 4.7 é realmente todo o caminho até aqui. É ainda menos eficiente do que as outras opções de ponta, como mostra a linha auditada. Mas se você estiver interessado em experimentar isso, ele já está disponível no Cursor e Groq Build e também através da API e outros provedores de terceiros. Então, se você estiver interessado, eu vou deixar um link para esta página principal na descrição abaixo.
Dialogue: 0,0:21:06.18,0:22:49.08,A,A,0,0,0,,Também nesta semana, o OpenAI lança seus modelos mais recentes, GPT-6 Sol e Luna. Agora a convenção de nomeação está ficando cada vez mais confusa, então vamos esclarecer isso. Atualmente, a família GPT-6 é composta por 3 categorias diferentes. Temos o Astro, que é a inteligência mais alta. Como você pode ver a partir deste gráfico, ele executa o melhor, mas também custa mais. E então a categoria média é SOL. Como você pode ver, os modelos SOL pontuam um pouco menos em termos de desempenho, mas é mais barato. E então a variante mais barata e leve é a categoria Luna. Aqui ele marca o menor, mas também é incrivelmente barato. Então você usaria os modelos Luna para tarefas muito rápidas e fáceis que realmente não requerem muito raciocínio. Então, se você olhar para sua inteligência geral, então GPT-6 SOL Max executa alguns pontos abaixo do GPT-6 Astra e os principais modelos Claude. No entanto, isto é muito mais barato. Custa basicamente mais de 3 vezes mais barato em comparação com GPT-6 Astra. E não vamos falar sobre os modelos Claude porque eles são muito caros. Agora, se você olhar para o modelo Luna menor, ele executa até aqui. Então, não realmente dentro como o top 5, mesmo abaixo do DeepSik e Jeminái 3.8. Mas, novamente, a vantagem dos modelos Luna é que eles são incrivelmente baratos. Eles são um dos modelos mais eficientes em termos de custo para usar. Então isso custa apenas 7 centavos por tarefa. Se compararmos isto com o modelo Claude mais caro, é mais de 100 vezes mais caro. Agora, em termos de disponibilidade, aqui diz que tanto os modelos SOL e LUNA estão disponíveis no GPT Work e Codex para todos os planos pagos. E então, para usuários gratuitos, você pode acessar o menor GPT Luna no aplicativo desktop já. Esses modelos ainda não estão disponíveis no Chat. Se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.
Dialogue: 0,0:22:49.39,0:23:58.14,A,A,0,0,0,,Também nesta semana, A Anthropic lança seu mais recente e melhor modelo, Claude Opus 5.5. Agora eu já fiz um vídeo de revisão completa testando o inferno fora dele, então se você estiver interessado, veja este vídeo para mais informações. Não vou repetir muito aqui, mas basicamente depois de alguns dias de testes, eis a sensação que tenho. Está entre os modelos de fronteira lá fora. É incrivelmente bom em como 3D e projetar e codificar coisas e também navegar através de sites e trabalhar com diferentes interfaces. Mas eu não diria que é significativamente melhor do que GPT-6 Astra. A inteligência deles é muito próxima. No entanto, se você olhar para o custo por tarefa, então Claude ainda é muito mais caro do que GPT-6 Astra. Então, pelo menos para mim, eu ainda prefiro apenas usar GPT-6. Os modelos Claude são demasiado caros. Mas de qualquer forma, se você estiver interessado em aprender mais, eu vou deixar um link para este vídeo na descrição abaixo. Agora, além de Opus 5.5, Anthropic também lança este blog alegando que eles descobriram um novo sistema enzimático para edição de genes. Então, os pesquisadores pediram a Claude para pesquisar uma enorme coleção de sequências de DNA para transcriptases reversas incomuns, que são basicamente enzimas que copiam RNA para DNA.
Dialogue: 0,0:23:58.66,0:25:11.90,A,A,0,0,0,,Assim, Anthropic usou aproximadamente 950 agentes usando 210 milhões de tokens, e depois de passar 21 horas, o agente notou esta cadeia de letras repetidas, que poderia estar relacionada com o mecanismo CRISPR, que é usado para edição de genes. Mas há uma ressalva importante aqui, que é que eles realmente não sabem o que isso faz. Portanto, isto requer mais investigação. Então a parte impressionante aqui não é que Claude descobriu uma ferramenta nova potencial para edição de genes. É que os agentes de IA procuraram independentemente um enorme conjunto de dados de ADN e limitaram-no a algo que poderia valer a pena testar. Agora, para ser justo, este anúncio da Anthropic também está recebendo algum empurrão de pessoas em biotecnologia. Algumas pessoas dizem que esta descoberta é muito menos significativa do que a transmissão do Anthropic. Então, esses pesquisadores afirmam que o DNA contém uma tonelada dessas sequências repetidas tipo CRISPR e combinações incomuns, e os cientistas já sabem que a maioria delas, em última análise, não se transformam em nada particularmente útil. Então encontrar outro padrão de sequência incomum não significa automaticamente que você descobriu um novo sistema de edição de genes. Então isso é uma ressalva importante aqui. O significado disto pode ser um pouco exagerado. De qualquer forma, se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.
Dialogue: 0,0:25:12.12,0:25:37.47,A,A,0,0,0,,Também esta semana, temos esta demo fixe da PrimeBot, e eles lançaram o que eles afirmam ser o robô pessoal transformavel do mundo. Chama-se PrimeBot T1, e como podem ver aqui, pode transformar-se de um modo quadrúpede tipo cão para um modo humanoide bípede. E este recurso transformador tem vários benefícios. Por exemplo, se você precisar dele para carregar coisas, então ele pode primeiro transformar-se em um cão e você pode apenas colocar as coisas em suas costas.
Dialogue: 0,0:25:37.85,0:25:56.14,A,A,0,0,0,,Ou quando você precisa dele para fazer algumas ações que exigem a forma humanóide, então ele também pode se transformar rapidamente. Um design muito interessante da PrimeBot. E isto é muito barato. Isto é apenas cerca de ¥20.000, que é como $2.800. Dizem que os carregamentos estão programados para começar em Outubro.
Dialogue: 0,0:25:56.44,0:26:29.17,A,A,0,0,0,,Também esta semana, o teu waifu está finalmente a caminho. Por isso temos uma nova atualização da UbiTech Robotics. Dizem que o primeiro lote desta série U1 de robôs humanóides super realistas estão sendo enviados agora. Eu já tinha apresentado estes robôs antes. Eles são projetados para ter rostos super realistas, cabelo, roupas e poses. Agora, estou um pouco surpreendido por não terem criado uma opção de mulher gato. Acho que esta é uma grande oportunidade perdida. Mas de qualquer forma, o mais emocionante é que esta semana eles finalmente anunciaram que pelo menos o primeiro lote desses robôs já estão sendo entregues.
Dialogue: 0,0:26:29.60,0:27:16.64,A,A,0,0,0,,Em outras notícias de robótica, a Unitree introduziu sua mais recente mão de robô dexterous, o Dex-5S, e esta é uma façanha incrível de engenharia. Este é um tamanho humano de 1 por 1. Está basicamente a tentar copiar uma verdadeira mão humana o mais de perto possível. Tem 22 graus de liberdade, o que significa que tem muitas articulações em movimento separadamente para que os dedos possam dobrar e posar e ser super flexíveis, como uma mão humana, em vez de uma garra de robô rígida. E aqui eles dizem que o preço começa em $6.500. Cada junta também tem proteção contra torque de impacto. Então, se a mão bate em algo, é projetado para limitar a batida. E como você pode ver a partir desta demonstração, isso pode fazer uma tonelada de coisas como segurar e manipular objetos, tocar teclas de piano, fazer alguns gestos de dedo, e usar tesouras para cortar papel.
Dialogue: 0,0:27:16.80,0:28:51.18,A,A,0,0,0,,Em outras notícias de robô humanóide, AI Skilled lançou uma demonstração impressionante. Eles estão basicamente fazendo AlphaGo, mas para o futebol humanóide. Assim, seu modelo principal de robótica é chamado de S1, e aqui eles estão treinando o robô para jogar futebol autonomamente. E a forma como eles treinam é como a DeepMind treinou o AlphaGo para se tornar de classe mundial em Go, apenas jogando milhões de rodadas contra si mesma em uma simulação. Bem, aqui estão eles fazendo o mesmo por este robô. Está a jogar futebol contra si próprio em simulação. E o futebol é uma escolha brutal de propósito. Isso requer uma tonelada de equilíbrio, velocidade, controle de bola, reações, e uma sensação de como o jogo realmente funciona. Então eles apenas deram a S1 um alvo, que é marcar, e eles deixaram jogar o equivalente a mais de 100 140 anos de futebol no simulador da NVIDIA chamado Isaac Sim. Agora, é claro, no início, sem qualquer conhecimento, ele cai. É muito desajeitado. Mas depois de algumas rodadas de aprendizado de reforço, ele foi capaz de driblar em torno de defensores, proteger a bola, e também atirar. Os adversários eram basicamente versões mais antigas de si mesmos. Assim, como uma versão ficou melhor, a próxima versão teve uma partida mais difícil. Isto é o que eles chamam de uma escada automática de treino. Então, depois de tanto treinamento, você pode então implantar isso de volta ao mundo real e você teria um robô humanóide que pode meio que jogar futebol autonomamente contra um humano. Agora, isso é apenas uma demonstração divertida, mas a mesma estratégia de auto-jogo em uma simulação pode ir além do futebol em coisas como navegar em torno de pessoas ou mover objetos ou auto-driving ou qualquer outro objetivo especificado. Se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.
Dialogue: 0,0:28:51.48,0:29:17.92,A,A,0,0,0,,Também nesta semana, temos uma tonelada de modelos menores que não são necessariamente fronteira, mas ainda vale a pena mencionar. Por isso, vou disparar rapidamente através deles. O primeiro é chamado de DOTS-3 Note, e este é por RedNote, que é como a versão chinesa de TikTok. Aqui, esta é uma mistura de modelos de especialistas com 208 bilhões de parâmetros. Quando você usa, apenas 16 bilhões estão ativos. Agora, este é um comprimento de contexto de 512 tokens, então um pouco menor do que os modelos de fronteira, que em geral têm um milhão de token janela de contexto.
Dialogue: 0,0:29:18.22,0:29:41.68,A,A,0,0,0,,No entanto, para o seu tamanho, é realmente muito bom. Então aqui estão algumas referências de codificação e resolução de problemas, e como você pode ver, ele é capaz de executar muito perto de modelos que são muitas vezes o seu tamanho. Por exemplo, KIMI-K3 é como 2,8 trilhões de parâmetros, que é como 10 vezes o tamanho. Aqui estão alguns outros parâmetros. Assim, em termos de compreensão multimodal, novamente, ele funciona muito bem dado o seu tamanho.
Dialogue: 0,0:29:41.96,0:30:10.44,A,A,0,0,0,,Na verdade, uma das coisas mais impressionantes sobre ele é a sua pontuação neste Arc AGI benchmark. Se você não está familiarizado com este benchmark, ele basicamente coloca o modelo de IA neste ambiente de jogo que ele nunca viu antes, e ele precisa aprender as regras do jogo por si só e basicamente ganhar o jogo. Agora, para a maioria dos modelos de IA, isso é realmente difícil de fazer porque eles realmente não podem tecnicamente aprender coisas novas ao longo do tempo. Os seus pesos modelo são fixos. Então, é muito difícil para eles aprender novas regras e aplicar esta nova informação à sua tomada de decisão.
Dialogue: 0,0:30:10.71,0:30:38.36,A,A,0,0,0,,Mas como você pode ver, pelo menos para esta pontuação AGI-2 Arc, esta nova nota DOTS 3 realmente executa o melhor fora dos modelos abertos. E também é muito barato. Então aqui eles deixaram isso como código aberto, eles lançaram o modelo completo e também uma variante FP8. O modelo completo é de 577GB de tamanho, enquanto o FP8 é muito menor em apenas 300GB. Um modelo multimodal de tamanho médio decente para experimentar. Se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.
Dialogue: 0,0:30:38.60,0:31:57.45,A,A,0,0,0,,Outro modelo aberto digno de nota é esta incorporação OVIS-VL. Então este é um modelo de incorporação, que é bastante diferente de um modelo de linguagem regular grande. Isto é basicamente projetado para pesquisar através de uma tonelada de informações diferentes usando o mesmo sistema. Então, em vez de ter um modelo para pesquisa de texto, outro para imagens, outro que busca vídeo, e outro que busca documentos, aqui este modelo de incorporação basicamente leva todos esses diferentes tipos de formatos e converte coloca-o na mesma representação numérica, também conhecido como o espaço de incorporação. Pense nisso como traduzir todos esses diferentes tipos de entradas em apenas uma linguagem universal. Agora, eles lançaram duas variantes diferentes disto. Há uma variante de parâmetros Omni 3 bilhões, que também leva em áudio, e então há também apenas uma variante de visão, que é 2 bilhões ou 9 bilhões de parâmetros, e isso pode levar em imagens e vídeos, mas não áudio. E se você comparar seu desempenho com outros modelos de incorporação de tamanho semelhante, então isso é em média o estado da arte. Assim, ambos os modelos são relativamente pequenos. O Vision-9B-1 tem 16,8 gigabytes de tamanho. O Omni-3B-1 é apenas 11 gigabytes. E o incrível é que os modelos estão sob a licença Apache 2, que tem restrições mínimas. Então este não é o seu modelo padrão de IA, mas se você precisar de um modelo de incorporação para converter diferentes formatos de entrada em um espaço compartilhado, então esta pode ser uma das melhores opções abertas para usar. Se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.
Dialogue: 0,0:31:57.72,0:33:05.70,A,A,0,0,0,,E fica ainda menor: temos outro modelo chamado Limite-1B Violetto. Além do design realmente estranho desta landing page, que meio que machuca meus olhos, este modelo Limite-1B é um modelo super minúsculo projetado inteiramente para uma coisa, que é resolver problemas de matemática realmente difíceis. Assim, você pode ver a partir deste marco matemático competitivo, ele marca como 94%. Mas porque é tão pequeno, ele usa muito menos computação em comparação com outros modelos maiores. Aqui estão alguns outros benchmarks matemáticos competitivos para sua referência. E como você pode ver em média, ele apenas bate em todos os outros modelos, que são como dezenas a centenas de vezes maior. Então, isto é super impressionante. Agora, como eu disse, isto é especializado para fazer apenas uma coisa, que é resolver problemas de matemática muito difíceis. Então não vai ser tão bem em outras tarefas gerais. Mas se você estiver interessado, no fundo aqui, eles liberaram o código e os modelos para isso. Então, se você rolar para baixo um pouco aqui, ele contém todas as instruções sobre como baixar e executar isso localmente. E em mil milhões de parâmetros, isto é super pequeno. Assim, o tamanho total de tudo é apenas como 2 gigabytes de tamanho. Você pode até mesmo fazer caber em GPU de baixo nível. Se você estiver interessado em ler mais, eu vou link para esta página principal na descrição abaixo.
Dialogue: 0,0:33:05.94,0:33:58.65,A,A,0,0,0,,Outro modelo aberto para colocar em sua lista é Aikido Altar. Este é um modelo de peso aberto que é especializado em segurança cibernética, então eles ajustaram-no em um dos melhores modelos abertos lá fora, GLM 5.3. Agora o modelo completo é como 1,5 terabytes de tamanho. É muito grande, mas com alguma engenharia inteligente, eles basicamente comprimi-lo até apenas 328 gigabytes, preservando a maior parte da qualidade de raciocínio do modelo completo. Assim você pode ver o tamanho reduzido deste modelo Alter em comparação com o modelo completo, e de 32 vulnerabilidades de seu conjunto de teste, Alter foi capaz de descobrir 23. Assim, seu desempenho não está tão longe do modelo completo, que foi capaz de descobrir 25. E isto são pesos abertos. Então aqui embaixo, se você clicar em baixar Alter, ele vai levá-lo para a página do Hugging Face, que contém os modelos e instruções sobre como usá-lo. Se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.
Dialogue: 0,0:33:59.20,0:34:43.74,A,A,0,0,0,,Também nesta semana, o Google divulga alguns novos detalhes sobre seu plano de enviar data centers para o espaço. Então isso é chamado Projeto Suncatcher, e eles estão basicamente explorando se nós podemos eventualmente construir sistemas de computação de IA maciça no espaço. A lógica por trás disso é que os centros de dados precisam de uma tonelada de eletricidade, enquanto os satélites em órbita baixa da Terra podem obter quase constante luz solar e potencialmente gerar até 8 vezes mais energia solar do que os sistemas na Terra. Mas antes de construir algo próximo de um data center espacial, eles primeiro precisam responder a uma pergunta muito mais simples, que é se chips de IA podem realmente sobreviver no espaço. O Google está preparando um protótipo de satélite que transporta os seus TPU de Trillium, ou Unidades de Processamento de Tensores, para testar exatamente isso.
Dialogue: 0,0:34:44.09,0:35:25.85,A,A,0,0,0,,Agora, um problema é colocar estes chips em órbita. Durante a viagem de aproximadamente 10 minutos para o espaço, a nave espacial pode gerar forças de até 10G, e você sabe, estes componentes de hardware podem experimentar até 100G. Então o Google basicamente amarrou esses chips de IA em uma máquina de vibração gigante e abalou-o como louco em todas as direções para simular um lançamento de foguetes. E surpreendentemente, o hardware sobreviveu. E há outro problema, que é a radiação. Uma vez que você está fora da atmosfera protetora da Terra, partículas solares e raios cósmicos podem bagunçar a eletrônica e até mesmo inverter bits individuais de dados. O Google testou as suas TPU dentro de uma instalação de feixe de prótons enquanto os chips estavam executando cargas de trabalho de IA.
Dialogue: 0,0:35:26.20,0:36:08.55,A,A,0,0,0,,E os primeiros resultados mostraram que esses TPU de Trillium poderiam suportar mais radiação do que o esperado. Agora, outro desafio é a refrigeração. Na Terra, os data centers de IA podem usar ar ou água para afastar o calor dos chips. Mas no espaço, não há fluxo de ar. O Google está experimentando tubos de calor e radiadores que afastam o calor dos processadores e depois irradiam-no para o espaço. Outra parte difícil sobre isso é que esses chips de IA precisam trocar toneladas de informação incrivelmente rapidamente. Não é só uma tonelada de chips de IA a trabalhar separadamente, certo? Assim, o Google também precisa desses satélites para se comunicar usando ligações laser de largura de banda muito alta, e manter esses lasers conectados requer extrema precisão.
Dialogue: 0,0:36:08.84,0:36:53.53,A,A,0,0,0,,O Google compara isto a como atingir um alvo do tamanho de uma moeda a milhas de distância enquanto ambos os lados estão se movendo. Então eles também precisam descobrir esta parte. De qualquer forma, o Google diz que planejam testar o sistema com dois satélites no próximo ano. Então, atualmente, a primeira missão do Google neste Projeto Suncatcher não é enviar um data center completo para o espaço ainda. Trata-se de provar que as peças básicas podem sobreviver. Os chips podem sobreviver através do lançamento? Conseguem lidar com anos de radiação? Eles podem manter-se frios no vácuo? E eles podem comunicar-se rapidamente uns com os outros no espaço sideral como um computador de IA enorme? Se essas coisas podem ser resolvidas, então o espaço pode eventualmente tornar-se um novo lugar para construir a infraestrutura de IA alimentada pelo sol. De qualquer forma, se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.
Dialogue: 0,0:36:53.91,0:37:48.70,A,A,0,0,0,,Também esta semana, tenha um modelo de imagem super minúsculo que pode até mesmo rodar no seu telefone. Agora isso é chamado de SupremaImage, e isso é apenas 100 milhões de parâmetros. Tenha em mente que os outros modelos de imagem lá fora são como pelo menos bilhões de parâmetros. Por exemplo, Z-Image tem 6 bilhões de parâmetros, então isso é 60 vezes menor. Agora, dado o seu tamanho, as imagens que ele pode gerar são de qualidade muito baixa, como você pode ver a partir destes exemplos, mas isso é esperado porque é realmente difícil embalar tanta inteligência em apenas 100 milhões de parâmetros. Mas o bom negócio aqui é que isso é pequeno o suficiente para rodar em apenas seu telefone ou outros dispositivos menores. Na parte inferior desta página, contém todas as instruções sobre como executar isto. Note que todo o modelo tem apenas 417 megabytes de tamanho. Se você estiver interessado em um modelo de imagem super minúsculo que pode até mesmo funcionar bem em seu telefone ou outros dispositivos menores, esta pode ser uma boa opção. Se você estiver interessado em ler mais, eu vou deixar um link para esta página principal na descrição abaixo.
Dialogue: 0,0:37:49.16,0:38:14.90,A,A,0,0,0,,E isso resume todos os destaques da IA esta semana. Deixe-me saber nos comentários o que você pensa de tudo isso. Qual das notícias foi a sua favorita, e qual ferramenta está mais ansioso para experimentar? Como sempre, estarei à procura das melhores notícias e ferramentas de IA para partilhar com vocês. Então, se você gostou deste vídeo, lembre-se de deixar um like, compartilhar, se inscrever e ficar ligado para obter mais conteúdo. Obrigado por assistir, e vejo você na próxima.
