KHTST — modelo multimodal PT-BR (v14: GSQ+RCO TOTAIS — RANDOM FOREST com buffer compacto Stiefel · RCO nas NoPE com COTA DO LOGIT · GATE GSQ nos mecanismos de atenção · AJUSTE ANALÍTICO K/τ_min · PERCEPÇÃO CONJUNTA com DETECÇÃO PARALELA DE ESCALA DE CINZA · LOTE EFETIVO por acumulação)

KHTST é um modelo multimodal compacto para PT-BR com roteamento por S-SOM, janela PARALELA de contexto (N_MAX_TOKENS 393.216), classificadores Jev auto-calibrados, o tronco causal híbrido MAMBA-3 5:1 (v12), otimização MuonClip + AdamW, a quantização GSQ (Gumbel-Softmax) com decaimento analítico de τ e restrição RCO no Stiefel com gradiente riemanniano no backward (v13) e — novidade v14 — a EXTENSÃO DO GSQ+RCO A TODOS OS MECANISMOS: Random Forest com buffer compacto (256×) e codebook Stiefel com DECORRELAÇÃO DAS ÁRVORES provada, RCO nas NoPE com cota estrutural do logit (ℓ_max ≤ d/√dh — QK-Clip estruturalmente INATIVO), GateGSQ nos mecanismos de atenção, ajuste analítico K/τ_min (trade-off compressão× erro do codebook), percepção conjunta imagem ⊕ profundidade ⊕ vit_lra com DETECÇÃO PARALELA DE ESCALA DE CINZA e lote efetivo por acumulação de gradiente. Provas em docs/matematica/27.

✅ TREINO CURTO REAL v14: APROVADO (6/6) — pareado A/B (corpus real de 620 registros, dois pontos de operação, honestos): • mesmos 60 UPDATES do otimizador: baseline 9,712 → 8,035 (1,209×) vs v14 total 9,752 → 5,707 (1,709× — 41% de ganho por update) com o lote efetivo 2 (2× dados por update, Var do gradiente ↓ √2); • mesmo orçamento de dados (60 lotes): v14 1,123× (lote dobrado faz metade dos updates — trade-off clássico, publicado). Métricas ESTRUTURAIS EXATAS: δ ortogonal das NoPE-Stiefel = 0,0, RF-GSQ buffer 256× menor (347.136 → 1.356 B reais), δ_ort do codebook 1,6e-06, erro VQ honesto 1,05 (cobertura), RF retreinado 7× (224 árvores), entropia do seletor 0,87 (afiamento), cinza_score 0,69 nos dados reais, gates da percepção conjunta vivos (α 0,0047 · γ₁ −0,024). Relatório: telemetria_out/metricas_v14.json.

✅ v13: ablação A/B (40 passos): GSQ+RCO 1,112× vs baseline 1,081×; δ_ort 7,9e-06; v12: sonda de fidelidade 0,021 (recarga ~100× mais fiel), 12 suítes verdes, RAM pico 3.066 MB ≤ 3.580. A corrida longa (8 h + 1 h) fica para o ambiente do usuário (scripts/04_treinar.py --teto_horas 9.0 --continuar_ate_horas 8.0 --estados_hf).

O que há de novo no v14 (provas em docs/matematica/27)

inovação onde prova
GSQ+RCO no RANDOM FOREST (eficiente): buffer compacto (id uint8 + norma fp16 = 3 B/amostra vs 4d B — 256×; matriz densa só no retreino, just-in-time); CODEBOOK STIEFEL aprendido pelo path suave da DNN (gradiente riemanniano — RGD); DECORRELAÇÃO DAS ÁRVORES: Cov(⟨u,c_a⟩,⟨u,c_b⟩) = ⟨c_a,c_b⟩/d = 0 para átomos ⊥ — derruba a parcela ρσ² de Breiman que o bagging NÃO remove; pesos de árvore ∝ 1/Var (Teo 23.7 fechado) ensemble/cabecas.py (CabecaRF_GSQ), quanta/gsq_rco.py (QuantizadorGSQRF) Teos 27.1, 27.3
RCO nas NoPE (W_q, W_k ∈ St(d,d)): cota ESTRUTURAL do logit ℓ_max ≤ ‖W_q‖₂‖W_k‖₂·max‖x‖²/√dh = d/√dh = 27,7 < τ_qk = 100 — QK-Clip ESTRUTURALMENTE INATIVO (a restrição riemanniana SUBSTITUI o clip corretivo; contraprova sem RCO: 3.269); proporção 5:1 preservada mamba3/hybrid.py, mamba3/tronco.py Teo 27.2
GATE GSQ nos MECANISMOS DE ATENÇÃO: seleção global/janela/linear dos encoders quantizada (GateGSQ — Concrete→Categorical com τ compartilhado; nascimento neutro uniforme; exploração Gumbel-max) + gate cooperativo com softmax_gsq sobre logits x-dependentes percepcao/atencao.py, percepcao/ortogonais.py, nucleo/modelo.py Teo 27.4
AJUSTE ANALÍTICO K/τ_min (compressão × erro): J(K) = (1−λ_c)·ε²(K) + λ_c·log₂K/log₂d; K* = argmin por varredura EXATA sobre o espectro REAL do buffer (verificação independente idêntica — K*=68); τ_min* = min(barreira, Δ₂/4) com Δ₂ o gap real dos logits (afiamento ≥ 98,2%); ECKART–YOUNG no modo subespaço: ε² = 1 − E(K) (Ky Fan) — ε² 0,75 → 0,55 por RGD quanta/gsq_rco.py (ajustar_k_tau_min), ensemble/cabecas.py (calibrar_k_tau_min) Teos 27.5, 27.6
PERCEPÇÃO CONJUNTA + CINZA PARALELO: PercepcaoConjunta (imagem ⊕ LRA-iluminação; DETECÇÃO PARALELA DE ESCALA DE CINZA sobre a imagem CRUA — χ = (max−min)/(max+ε), s = 1−χ̄: identidade R=G=B ⟹ s=1 EXATO, Lipschitz 2δ/m̄ honesta, gate γ_c nascido 0); nascimento neutro α=0 (‖Δ‖ = 0,0 exato); canal 3D intacto (não-expansão T25.4 preservada) percepcao/percepcao_conjunta.py (novo), percepcao/vit_lra.py Teos 27.7, 27.8
LOTE EFETIVO por ACUMULAÇÃO DE GRADIENTE (requisito "aumentar lote" sob RAM 4 GiB): E[ĝ_acc] = ∇L(lote cheio) EXATO (linearidade); Var ↓ √n_acc; lote FÍSICO 4 (RAM) · EFETIVO 2–16; τ avança por OTIMIZADOR (não por micro); PCGrad compatível; exato em modelo linear medido (3e-8) treino/treinador.py Teo 27.9
Alcance configurável (opt-in): gsq_rco.alcance = [alinhamento, nope, gate_atencao, gate_cooperativo] + ensemble.quant_gsq + modelo.percepcao_conjunta + treino.lote_efetivo — cfg v13 reproduz o v13 BIT-A-BIT (regressão T27.10) config.py Teo 27.11

O que houve no v13 (provas em docs/matematica/26)

inovação onde prova
GSQ (Gumbel-Softmax Quantization): logits (n×K) + codebook de centros; y_soft = softmax((l+g)/τ) com g ~ Gumbel(0,1); τ→0 ⟹ one-hot a.s. (Concrete→Categorical); barreira do gradiente 1/(2τ) ⟹ piso τ_min = 0,25 quanta/gsq_rco.py Teos 26.4-i/ii
DECAYMENTO ANALÍTICO de τ: τ(t) = τ_min + (τ_0−τ_min)·e^(−t/T_τ); inversão exata t*(δ) = T_τ·ln((τ_0−τ_min)/δ) ⟹ T_τ = t_alvo/ln((τ_0−τ_min)/δ) (defaults: τ_0=2,0, τ_min=0,25, δ=0,05, t_alvo=600 ⟹ T_τ=308,1); Σ 1/τ(t) finita (Robbins–Monro preservado) quanta/gsq_rco.py (AgendadorTau), treino/treinador.py (hook pós-step) Teos 26.5-i/ii/iii
RCO — STIEFEL (matriz ortogonal COMPLETA): W_ort = R(y_soft·C) com retração QR de sinal positivo — W_ortᵀW_ort = I EXATO a cada forward (2,9e-14 float64; 7,9e-06 float32) — restrição INVARIANTE do fluxo (sem renormalização periódica); retração alternativa polar/SVD (Procrustes — Eckart–Young) quanta/gsq_rco.py (RetracaoStiefel/MatrizStiefel), acelerado/rco_gsq.pyx Teos 26.1, 26.1-b, 26.9-i
GRADIENTE RIEMANNIANO no backward (Projeção da Tangente): g = P_Y(Ĝ) = Ĝ − Y·sym(YᵀĜ) — adjunto EXATO no tangente (err ≤ 5,7e-10), gradiente tangente (resíduo 3,8e-14), LEMA DA DESCIDA no manifold (4,39 → 0,68); treino PONTA A PONTA (RGD de Absil/Boumal no autograd) quanta/gsq_rco.py Teos 26.2, 26.3-a/b/c/d
KERNEL CYTHON OpenMP/BLAS/LAPACK: rascunho do usuário analisado — 5 bugs corrigidos (B1 alocação em nogil; B2 LAPACK column-major; B3 work-query + info; B4 GEMM + layout col-major; B5 aliasing in-place no sinal) e 4 melhorias (dgemm AVX-512, −ffast-math REMOVIDA com justificativa IEEE-754, prange static, métricas/seed expostos) acelerado/rco_gsq.pyx (novo), acelerado/setup.py Teo 26.6, doc 26 §5
PIPELINE HÍBRIDO CPU/GPU com detecção automática: CUDA → CuPy → CPU OpenMP; mesma semente Gumbel nas engines; equivalência provada — PROJETOR colunar único Q·Qᵀ = P_span(M) (QR×polar: 1,9e-15, vale rank-deficiente) e MESMA retração QR-sign em engines distintas (2,4e-13, rank cheio); QR-sign ≠ polar (rotação W = HR⁻¹ — nota honesta) scripts/12_gsq_rco_hibrido.py (novo), quanta/gsq_rco.detectar_hardware Teos 26.7, 26.8-a/b/c/d/e
Integração treino: modo de alinhamento opt-in ("qr" default — nascimento neutro; "rco"; "gsq_rco"), agendador de τ COMPARTILHADO no treinador, telemetria gsq_rco/tau·entropia·erro_ort, gate GSQ no AdamW (Newton-Schulz proibido em parâmetros de seleção — Teo 26.10) nucleo/modelo.py, treino/treinador.py, treino/otimizadores.py, config.py Teos 26.9, 26.10, 26.11
Métricas verificadas (A/B com dados reais): GSQ+RCO aprende 1,112× vs 1,081× do baseline em 40 passos (τ ainda alto — o ganho cresce com o afiamento); gradientes vivos nos 3 grupos (logits 6,9e-3 · centros 9,9e-3 · escala 3,3e-2) scripts/13_treino_curto_v13.py (novo), telemetria_out/metricas_v13.json doc 26 §8

O que houve no v12 (provas em docs/matematica/24 e 25)

inovação onde prova
TRONCO MAMBA-3 substitui o transformer: a pilha causal principal (6 camadas) agora é CamadaTroncoM3 — 5 Mamba-3 seletivas + 1 NoPE (proporção EXATA do requisito), microunidades/MoE/roteador preservados nos canais; MixtureOfAttention REMOVIDA do tronco mamba3/tronco.py (novo), nucleo/modelo.py Teos 24.12, 24.14
Decode INCREMENTAL equivalente à varredura: prefill semeia (h_L, janela) e o decode T=1 aplica a recorrência de UM passo — memória O(1)/camada Mamba-3, KV-cache só na NoPE (÷6); Δ = 1,8e-06 medido mamba3/hybrid.py, kernel.py Teo 24.13
MuonClip + AdamW: Muon (momentum Nesterov + Newton-Schulz quintico — descida MAIS ÍNGREME sob ‖·‖₂, progresso ∝ ‖G‖_*) nas matrizes do tronco; AdamW nas tabelas lexicais/vetores (ortogonalização proibida — Teo 24.6); UM otimizador, compatível com ABMO/CIAR/RPP (η único — Teo 24.9) treino/otimizadores.py (novo) Teos 24.1–24.11
QK-Clip: ℓ_max medido por forward; W_q escalado por γ = τ/ℓ_max pós-step — invariante ℓ_max ≤ τ, softmax JAMAIS satura (p_max limitado), W_k/W_v intocados treino/otimizadores.py Teos 24.7–24.8
Percepção 3D PROVADA: profundidade por bins ORDINAIS (isotonia — 0 inversões), distância radial LIPSCHITZ (3π/R_max), camadas topológicas com separação mínima, fusão NÃO-EXPANSIVA (α+β+γ=1) percepcao/profundidade.py (novo), mamba3/mamba3vl.py Teos 25.1–25.4
ACELERAÇÃO da percepção 3D: O(P) vs O(P²) em 6 camadas — P*=320 pontos de equilíbrio; 1,65× @P=500, 3,61× @P=2000, →6× com P (contagem no teste) percepcao/profundidade.py Teos 25.5–25.6
Produtor 3D com dados REAIS: nuvens do lote visual pelo proxy calibrado z = 1 − L^γ (monotônico, Lipschitz, DECLARADO); Mamba-3VL TREINA (codificar_multimodal sem no_grad, gradiente na nuvem + profundidade) treino/treinador.py Teo 25.7
ACESSO LÓGICO AOS DIFUSORES: RoteadorDifusao — partição bayesiana DISJUNTA e COMPLETA das rotas (txt2img/img2img/inpaint), prior de intenção limitado (entropia ≤ ln 13), Teo 17.1 com embeddings REAIS, seed determinística, PNG no retorno, import LAZY de diffusers geracao/difusao.py, nucleo/modelo.gerar_imagem Teos 25.8–25.10
Órfãos corrigidos (13): bug LISTA_TAREFAS sem import (NameError latente na fase SOM), bug _ultimo_oculto_mamba3 (features do ensemble nunca vinham do Mamba-3), perda_total morta REMOVIDA, INTENCOES 13 = fonte única, janela 1M na sessão adhoc, CacheRAM no cache RLHF, HubFerramentas+CicloPDCA no canal/serviço, documentos locais na coleta, classificador de protótipos no teste real múltiplos módulos doc 25 §9 (tabela)
Fidelidade de recarga (análise de métricas): sonda δ 2,0 → 0,021 (pós-treino) e 0,0 exato em eval limpo; janela/classificador cobertos pelos extras mx/ (sem duplicação de memória no safetensors — detectado e corrigido no treino real) treino/estado_integral.py doc 25 §10

Reprodução (corrida v12)

python3 scripts/01_verificar_ambiente.py
python3 scripts/10_teste_dados_reais.py        # GATE: dados reais ANTES do treino longo
python3 scripts/11_coleta_curta_v12.py         # coleta curta (validação) — opcional
python3 scripts/02_coletar_corpus.py           # coleta completa (inclui fonte local v12)
python3 scripts/03_treinar_tokenizador.py
python3 scripts/04_treinar.py --orcamento 1500 \
    --teto_horas 9.0 --continuar_ate_horas 8.0 \
    --estados_hf                               # estados ao Hub antes de 900 MB
python3 scripts/05_avaliar.py
python3 scripts/08_graficos_card.py
python3 scripts/06_publicar_hf.py              # commit único (sem uploads parciais)

Núcleos acelerados (Cython+C — OBRIGATÓRIOS, Teo 21.13):

cd src/khtst/acelerado && python3 setup.py build_ext --inplace
python3 -c "from khtst.acelerado import status; print(status())"

Arquitetura v12 (12 tarefas, ~18,0M parâmetros)

src/khtst/ — núcleo (LM head empatada + janela 393K), mamba3/ (kernel trapezoidal + tronco híbrido 5:1 + decode incremental + 3D-VL bidirecional + checkpointing), percepcao/profundidade.py (canais provados de profundidade/distância/camadas), geracao/difusao.py (roteador lógico dos difusores), treino/otimizadores.py (MuonClip+AdamW), ensemble/ (RF + DNN + destilação bidirecional + engram), memória (S-SOM + 8 variantes), treino (4 fases + PCGrad + CIAR + gates + DPO RLHF real), servico (adhoc com ferramentas + janela 1M), quanta (W8A8), telemetria, qualidade (Agente Engenheiro), acelerado (Cython+C).

Tarefas: lm · noticia · pontuacao · instrucao · tts · vqa · ocr · imagem_caption · asr · traducao · raciocinio · classificacao

componente detalhe
tronco principal (v12) MAMBA-3 híbrido 5:1 — 6 camadas [M,M,M,M,M,A], d=192, N=16, rank MIMO 4, d_ff 512; microunidades+MoE enc-dec nas camadas compostas; checkpointing ON
decode prefill varredura → estados (h, janela) → recorrência de 1 passo; KV-cache SÓ na NoPE (1/6 das camadas)
otimizador MuonClip + AdamW: Newton-Schulz 5 it. nas matrizes (momentum 0,95 nesterov, escala 0,2·max(1,√(m/n))), AdamW (0,9; 0,95; wd 0,01) nas tabelas; QK-Clip τ=100
Mamba-3VL 3D-VL bidirecional (6 camadas) + percepção de profundidade (16 bins), distância radial, 4 camadas topológicas; nuvem (B,P,3) ⊕ texto
difusores roteador lógico txt2img/img2img/inpaint + força semântica real + seed determinística + ciclo fechado SOM
ensemble RF 32 árvores (warm_start) × DNN 96-48 × engram 256×8; KD simétrica τ=2; features DO TRONCO Mamba-3; v14: buffer COMPACTO GSQ (3 B/amostra) + codebook Stiefel + pesos ∝ 1/Var
percepção conjunta (v14) imagem ⊕ LRA-iluminação com detecção PARALELA de cinza (s = 1−χ̄) e fusão neutra α=0; canal 3D da profundidade fundido no Mamba-3VL (não-expansivo)
janela de contexto entrada 256K + saída 128K (N_MAX_TOKENS = 393.216), janelas paralelas W=192K/E=64K
classificadores Jev escolha/escore/noul + critérios DINÂMICOS + classificador de protótipos reais

Verificações (verdes)

  • Suíte v14 (nova): 39 ✓ — decorrelação das árvores (Cov 3e-4 vs 6,3e-3), cota do logit NoPE-RCO (4,3 ≤ 27,7; contraprova 3.269), buffer VQ 256×, Eckart–Young no subespaço (0,55 < 0,75), K* argmin exato (68/68), barreira dupla τ_min, cinza (identidade s=1,0; Lipschitz 0,034 ≤ 0,040), percepção conjunta neutra (‖Δ‖ = 0,0), acumulação exata (3e-8), integração total + regressão v13.
  • 13 suítes verdes: 465 ✓ / 0 ✗ (v1 25 · v2 36 · v3 ✓ · v4 37 · v5 32 · v6 48 · v7 44 · v9 21 · v10 ✓ · v11 ✓ · v12 28 · v13 27 · v14 39).

Histórico

  • v11 — Mamba-3 híbrido auxiliar, Mamba-3VL, checkpointing, ensemble RF×DNN×KD×Engram, 12 tarefas, 9 datasets + RLHF real, estados < 900 MB.
  • v10 — janela paralela 256K→128K, classificadores Jev (ppl_lm 2,58 vs AURORA 17,09). v9 — estado integral + gates + CIAR. Docs 00–25 com as provas completas.

Licença

MIT (herdada do projeto).

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support