A Microsoft lança o MAI-Voice-2-Flash, com uma redução máxima de 89% nos custos de GPU

MSFT-2,24%
Key Takeaways
  • A Microsoft lançou MAI-Voice-2-Flash e MAI-Image-2.5-Pro em pré-visualização pública a 23 de julho, com reduções de custos significativas.
  • Os centros de atendimento ao cliente da Microsoft alcançaram uma redução de 89% nos custos de computação após adotarem o MAI-Voice-2-Flash para processamento de voz.
  • O MAI-Code-1-Flash pode ser executado em GPUs H100 e A100 mais antigas, mantendo o desempenho do GPT-5.6 em tarefas relacionadas com o Excel.

A Microsoft divulgou a 23 de julho dois modelos novos em pré-visualização pública: MAI-Image-2.5-Pro e MAI-Voice-2-Flash; em simultâneo, revelou dados internos: depois de os centros de apoio ao cliente passarem a usar o MAI-Voice-2-Flash, o custo de computação baixou 89%. O CEO da Microsoft, Satya Nadella, disse que, quando os modelos da empresa empatam ou superam as soluções de ponta, encaminham o tráfego para o MAI.

Focalização e preços de MAI-Image-2.5-Pro e MAI-Voice-2-Flash

O MAI-Image-2.5-Pro está orientado para a geração de imagens de alta qualidade; tem preço de 5 dólares por milhão de tokens de texto de entrada e 106 dólares por milhão de tokens de imagem de saída. O Bing Image Creator já passou totalmente a usar o MAI-Image-2.5; Rob Reilly, diretor global de criatividade da WPP, afirmou no anúncio da Microsoft que se trata de um “salto importante” para as ferramentas de media gerada.

O MAI-Voice-2-Flash está orientado para cenários de processamento intensivo de voz (como centros de apoio ao cliente), sendo o dobro mais rápido do que o antecessor e com custos inferiores em 32%. Depois de o centro de apoio ao cliente trocar para este modelo, o custo de computação baixou 89%. Este anúncio divulga ainda os resultados da implementação no Bing Image Creator, PowerPoint (o custo de GPU é 84% menor do que o do GPT-Image-2), OneDrive (taxa de armazenamento +26%, latência -25%) e Dragon Copilot (taxa de erro -50%).

Resultados concretos de poupança em custos de GPU

A Microsoft revelou, no anúncio, os resultados de cada cenário da seguinte forma:

MAI-Voice-2-Flash (voz para centros de apoio ao cliente):custo de computação -89%; duas vezes mais rápido do que o antecessor, com -32% nos custos

MAI-Image-2.5-Pro (PowerPoint):custo de GPU -84% face ao OpenAI GPT-Image-2

OneDrive ao trocar de modelo:taxa de armazenamento +26%, latência reduzida em cerca de 25%

Dragon Copilot (MAI-Transcribe-1.5, transcrição médica):atendeu 170 mil profissionais de saúde; no trimestre anterior processou 28 milhões de registos de doentes; com a transcrição e identificação de idioma em 58 línguas, a taxa de erro na transcrição e na identificação linguística diminuiu relativamente 50%

MAI-Code-1-Flash (GitHub Copilot):a taxa de adoção de código é cerca de 10% superior à do GPT-5.4 Mini e do Claude Haiku 4.5; consumo de tokens -10%; pode ser executado em GPUs H100 e A100

A estratégia de “roda” de Nadella e a lógica de encaminhamento de tráfego para o MAI em vez de modelos de ponta

Nadella publicou no X um post intitulado “A difusão de fronteira e o controlo”, no qual expõe a estratégia de modelos da Microsoft: quando os modelos próprios apresentam desempenho em linha ou superior às alternativas de ponta, encaminham o tráfego para o MAI, fornecendo serviços a maior escala com menor custo. O que sustenta esta estratégia é a metodologia “hill-climbing”: fazer com que os dados, o modelo e o produto formem uma “cascata de sistemas” em iteração contínua, em vez de depender de um único treino para decidir o sucesso ou o fracasso.

Ele também referiu que o sistema de avaliação “mesmo que elimine qualquer um dos modelos, deve continuar a subir” — mantendo memória e capacidades fora do modelo, criando o verdadeiro controlo que a Microsoft detém. Depois de o MAI-Code-1-Flash ser afinado num ambiente de aprendizagem por reforço no Excel, consegue correr em GPUs mais antigas H100 e A100, empatando com o GPT-5.6 na maioria das tarefas do Excel, ao mesmo tempo que liberta o cluster mais recente GB200 para treino em vez de pedidos de serviço.

Perguntas frequentes

Qual é o preço do MAI-Image-2.5-Pro e do MAI-Voice-2-Flash, respetivamente?

O MAI-Image-2.5-Pro custa 5 dólares por milhão de tokens de texto de entrada e 106 dólares por milhão de tokens de imagem de saída, estando disponível na pré-visualização pública do Azure. O MAI-Voice-2-Flash é duas vezes mais rápido do que o antecessor e tem custos 32% mais baixos; os detalhes do preço devem ser confirmados no anúncio oficial do Azure.

De quanto é que a Microsoft afirma que os custos de GPU podem cair com a mudança para modelos MAI?

Com base nos dados internos divulgados pela Microsoft, depois de os centros de apoio ao cliente passarem a usar o MAI-Voice-2-Flash, o custo de computação baixou 89%; após a substituição do PowerPoint por um modelo de imagem MAI, o custo de GPU ficou 84% abaixo do GPT-Image-2; ao trocar o Dragon Copilot por MAI-Transcribe-1.5, a taxa de erro na transcrição e na identificação de idioma baixou, em termos relativos, 50%. No entanto, todos os valores acima provêm de avaliações internas da Microsoft e não de testes de referência independentes de terceiros.

Como é que os clientes empresariais usam o método de treino da Microsoft com MAI através do Azure?

A Microsoft, através dos produtos Foundry e Frontier Tuning do Azure, permite que os clientes empresariais usem os seus próprios dados para treinar modelos dedicados; a Microsoft sublinha que estes modelos são treinados a partir de dados empresariais “limpos” e “rastreáveis”, sem passar por destilação a partir de modelos de terceiros, para responder a questões de conformidade sobre a origem dos dados de treino.

Aviso legal: As informações contidas nesta página podem provir de fontes externas e têm caráter meramente informativo. Não refletem os pontos de vista nem as opiniões da Gate e não constituem qualquer tipo de aconselhamento financeiro, de investimento ou jurídico. A negociação de ativos virtuais envolve um risco elevado. Não se baseie exclusivamente nas informações contidas nesta página ao tomar decisões. Para mais detalhes, consulte o Aviso legal.
Comentar
0/400
Nenhum comentário