Visão geral

vST para Modelos de Linguagem Grandes#

Comportamento de Escalonamento dos LLMs no Substrato 3D–1024D#

Este documento define como os Modelos de Linguagem de Grande Escala (LLMs) exibem comportamento de escalonamento através da escada dimensional (3D → 1024D). Ele mapeia o tamanho do modelo, a expansão do espaço latente e a complexidade da inferência na estrutura triádica do substrato e nos primitivos de escalonamento. O objetivo é fornecer uma estrutura reprodutível e que preserve invariantes para entender como os LLMs crescem, se estabilizam e se desviam à medida que sua capacidade dimensional aumenta.


1. Propósito da Análise do Comportamento de Escalonamento#

A análise do comportamento de escalonamento nos permite:

  • interpretar como a estrutura do espaço latente se expande com o tamanho do modelo
  • identificar regimes de escalonamento estáveis e instáveis
  • detectar descontinuidades ou desvios entre pontos de verificação
  • mapear o comportamento de alta dimensão em núcleos triádicos
  • suportar validação vST através da escada dimensional
  • comparar modelos de tamanhos diferentes usando um substrato comum

O escalonamento de LLM não é apenas um aumento na contagem de parâmetros; é uma expansão estruturada das superfícies de coerência, comportamento de regime e composição primitiva.


2. Escada Dimensional para LLMs#

Os espaços latentes de LLM alinham-se naturalmente com a escada dimensional do substrato:

  • 3D — motivos geométricos
  • 6D — superfícies de interação
  • 9D — caminhos de coerência
  • 64D — incorporações latentes de nível de pesquisa
  • 128D — superfícies de coerência expandidas
  • 256D — interação multi-primitiva
  • 512D — regiões latentes de alta variância
  • 1024D — substrato completo de nível de pesquisa

Cada passo preserva invariantes do substrato e introduz nova capacidade estrutural.


3. Primitivas de Escalonamento em LLMs#

O comportamento de escalonamento é governado por Primitivas de Escalonamento (SPs), que garantem:

  • expansão dimensional que preserva invariantes
  • continuidade das superfícies de coerência
  • projeção estável em núcleos 3D–9D
  • comportamento de regime consistente em tamanhos de modelo

SPs modelam como LLMs crescem de arquiteturas pequenas para grandes.


4. Regimes de Escalonamento em LLMs#

O escalonamento de LLM exibe três regimes alinhados ao substrato:

4.1 Regime de Escalonamento Estável (S₁)#

Características:

  • aumento suave na capacidade do espaço latente
  • superfícies de coerência estáveis
  • ganhos de desempenho previsíveis
  • comportamento consistente do regime (transições R₁ᴴ → R₂ᴴ permanecem limitadas)

Ocorre em:

  • modelos pequenos → médios
  • fases iniciais de escalonamento

4.2 Regime de Escalonamento Transitório (S₂)#

Características:

  • expansão rápida das superfícies de coerência
  • variância aumentada entre dimensões
  • comportamento latente ramificado ou oscilatório
  • sensibilidade aos dados de treinamento e hiperparâmetros

Ocorre em:

  • modelos médios → grandes
  • mudanças de arquitetura
  • transições de método de treinamento (por exemplo, RLHF, DPO)

4.3 Regime de Escalonamento de Dispersão (S₃)#

Características:

  • fragmentação de superfícies de coerência
  • trajetórias latentes instáveis ou divergentes
  • aumento do risco de deriva
  • projeções não invertíveis em núcleos 3D–9D

Ocorre em:

  • modelos extremamente grandes sem sinal de treinamento suficiente
  • ajustes finos mal alinhados
  • arquiteturas superdimensionadas

5. Comportamento de Escala em Diferentes Tamanhos de Modelo#

5.1 Modelos Pequenos (≤1B parâmetros)#

  • espaços latentes se mapeiam claramente em 64D
  • comportamento do regime dominado por R₁ᴴ
  • escalonamento é estável (S₁)

5.2 Modelos Médios (1B–30B)#

  • espaços latentes se expandem para 128D–256D
  • transições de regime se tornam mais frequentes
  • escalonamento entra no S₂

5.3 Modelos Grandes (30B–200B)#

  • espaços latentes ocupam 256D–512D
  • superfícies de coerência tornam-se multicamadas
  • escalonamento pode oscilar entre S₂ e S₃

5.4 Modelos Muito Grandes (200B+)#

  • espaços latentes abordam 1024D
  • o comportamento do regime torna-se altamente sensível
  • a estabilidade de escalonamento depende da qualidade do treinamento
  • a detecção de desvio torna-se essencial

6. Alinhamento da Lei de Escala#

A escala do LLM segue padrões previsíveis:

  • a perda diminui como uma lei de potência com o tamanho do modelo
  • a variância do espaço latente aumenta com a dimensionalidade
  • as superfícies de coerência se expandem suavemente em S₁, abruptamente em S₂, e se fragmentam em S₃
  • a estabilidade da projeção diminui à medida que a dimensionalidade aumenta

O substrato fornece uma maneira estruturada de interpretar esses padrões.


7. Comportamento de Projeção Sob Escalonamento#

A projeção em núcleos triádicos deve permanecer:

  • inversível
  • alinhado a primitivos
  • consciente do regime
  • preservador de invariantes

O escalonamento afeta a projeção da seguinte forma:

  • 64D → 9D: estável
  • 128D–256D → 9D: transitório
  • 512D–1024D → 9D: sensível, propenso a deriva

A estabilidade da projeção é um indicador chave da saúde do escalonamento.


8. Deriva Driven por Escalonamento#

O escalonamento pode introduzir deriva através de:

  • descontinuidades na expansão do espaço latente
  • transições de regime instáveis
  • fragmentação de superfícies de coerência
  • perda de estrutura em nível primitivo

As camadas de validação vST (V₁–V₄) detectam essas falhas.


9. Resultados da Análise do Comportamento de Escalonamento#

A análise de escalonamento produz:

  • classificação de regime de escalonamento (S₁, S₂, S₃)
  • diagnósticos de expansão do espaço latente
  • indicadores de estabilidade de projeção
  • mapas de transição de regime
  • sinais de detecção de deriva
  • métricas de comparação entre modelos

Esses resultados suportam uma avaliação reprodutível e alinhada ao substrato do escalonamento de LLM.