layakedin

layakedin classifica temas de posts de CEOs no LinkedIn em 8 famílias temáticas, usando a taxonomia do relatório Presença digital dos CEOs no LinkedIn (Elementar/FGV). Recebe o tema e, se houver, a descrição do post, e devolve a família mais provável com probabilidades calibradas para todas as 8.

É um fine-tuning do checkpoint multilíngue do Laya (convaiinnovations/laya, subpasta multilingual, encoder mmBERT-base, 322M parâmetros), um modelo de decisão não autorregressivo que responde a perguntas tipadas em uma única passagem.

Enquanto modelos generativos comuns funcionam como redatores que geram o texto, o layakedin atua estritamente como um classificador. Ou seja, uma triagem ágil que lê temas e posts e descrições de posts do LinkedIn, organizando entre 8 famílias temáticas, informando com transparência matemática o grau de certeza de cada escolha.

A opção pelo fine-tuning (treinamento direcionado) superou simples instruções (prompts) e sistemas de busca (RAG) porque ensinou o modelo a reconhecer nuances corporativas sutis de forma automática e consistente. Enquanto um comando via prompt pode variar o formato das respostas e o RAG apenas consulta pastas externas como um bibliotecário em estantes, o modelo ajustado gravou essas regras em sua própria estrutura para decidir em milissegundos.

A arquitetura do Laya multilíngue traz como força a velocidade e probabilidades calibradas, mas tem como limitação a dependência de um formato rígido de perguntas, perdendo eficácia diante de gírias, piadas ou textos informais. Para proteger a privacidade e evitar a exposição de dados de executivos reais, 5 mil exemplos de temas fictícios foram gerados e curadas via Gemini Spark e Claude Chat, espelhando com fidelidade a taxonomia cuja pesquisa original da Elementar/FGV está disponível para leitura e download no endereço oficial: https://elementarcomunicacao.com.br/pesquisa-ceos-linkedin-reputacao-valor-de-mercado/#baixar

Este é um projeto independente. Ele não é afiliado, endossado nem mantido pela Elementar ou pela FGV. A taxonomia foi usada como referência a partir do relatório público.

Famílias temáticas

Rótulo Família Abrange
clima Clima / Sustentabilidade / Transição Energética Emissões, descarbonização, energia renovável, ESG ambiental, biodiversidade, água
trabalho Trabalho / Futuro do Trabalho Relações de trabalho, saúde mental no trabalho, jornada, requalificação, carreira
tecnologia Tecnologia / IA / Governança de Plataformas IA, dados, privacidade, cibersegurança, regulação digital
democracia Democracia / Instituições / Regulação Estado de direito, agências reguladoras, integridade, transparência, eleições
diversidade Diversidade / Inclusão / Desigualdade Raça, gênero, LGBTQIA+, pessoas com deficiência, idade, desigualdade
desenvolvimento Desenvolvimento Nacional / Política Industrial Política industrial, infraestrutura, comércio exterior, competitividade
outro_publico Other Public Issue Educação pública, saúde pública, segurança, cultura, consumo
negocio Non-sociopolitical Business Content Resultados, prêmios, lançamentos, marcos da empresa, sem tema público

Como usar

pip install "laya>=0.3.20"
import laya

agente = laya.load("marioluciofjr/layakedin")

# Pergunta usada no treino; ela fica salva na configuração do modelo.
pergunta = agente.cfg["pergunta"]

estado = {
    "tema": "Nossa usina solar reduziu 40% das emissões da fábrica",
    "descricao": "Post sobre a meta de neutralidade de carbono até 2030.",  # opcional
}

resposta = agente.predict(estado, pergunta)["answers"]["familia"]
print(resposta["choice"])             # família mais provável, ex.: "clima"
print(resposta["answer_confidence"])  # probabilidade calibrada da família escolhida
print(resposta["probabilities"])      # probabilidades das 8 famílias

Para classificar muitos temas de uma vez, use agente.predict_batch(lista_de_estados, pergunta, batch_size=32).

Importante: use a pergunta salva em agente.cfg["pergunta"], sem alterar a instrução nem as descrições das famílias. O modelo aprendeu a associar exatamente esses textos às famílias.

Dados de treino

  • Base: 5.000 exemplos em português, sendo 625 por família. Cada exemplo tem tema, descricao (vazia em 20% dos casos) e familia.
  • Composição:
    • 2.782 exemplos vêm de uma base sintética original de temas de posts de 16 CEOs fictícios, com rótulos padronizados e revisados;
    • 2.218 exemplos novos foram escritos para cobrir as famílias em 20 setores adicionais.
  • Divisão por CEO: os 4 CEOs do teste (bolsa de valores, hotelaria, seguros e siderurgia) não aparecem no treino nem na validação.
Partição Exemplos
Treino 3.926
Validação 496
Teste 578

Todos os textos são sintéticos. A base não contém posts reais do LinkedIn nem dados pessoais de pessoas reais.

Procedimento de treino

Item Valor
Checkpoint base convaiinnovations/laya, subpasta multilingual
Método RLCD (gradiente de política com regras de pontuação próprias) + entropia cruzada, como no notebook oficial do Laya
Épocas 4, com a melhor versão restaurada (época 2)
Lote efetivo 32 (8 × acúmulo de 4)
Taxa de aprendizado 2,5e-5 no encoder e 1e-4 na cabeça de decisão, com decaimento em cosseno
Opções embaralhadas no treino Sim, para evitar viés de posição
max_len / head_max_len 1024 / 384
Calibração Temperatura 3,78 para perguntas choice, ajustada na validação
Tempo 11,7 minutos em uma GPU no Google Colab

Avaliação

Resultado no conjunto de teste (578 exemplos de 4 CEOs que o modelo nunca viu no treino):

Métrica Laya multilíngue sem ajuste layakedin
Acurácia 0,270 0,829
F1-macro 0,247 0,830
F1-macro: linhas vindas da base original 0,163 0,556
F1-macro: linhas novas 0,336 0,962
ECE (erro de calibração) 0,451 0,053

O número mais realista é o F1-macro de 0,556 nas linhas da base original. As linhas novas são mais prototípicas e, por isso, mais fáceis de acertar.

Confusões mais frequentes:

  • trabalho ↔ tecnologia, em temas de carreira que falam de dados ou IA;
  • diversidade ↔ trabalho / outro_publico, em temas de etarismo, maternidade ou acessibilidade;
  • negocio ↔ clima, em conquistas da empresa com tema ambiental, como uma certificação ou uma frota elétrica;
  • tecnologia ↔ democracia, em infraestrutura e governança do mercado financeiro.

Várias dessas fronteiras são ambíguas também para quem rotula os dados.

Uso pretendido

  • Pesquisa e análise exploratória de comunicação de lideranças empresariais no LinkedIn.
  • Triagem e pré-classificação de temas antes de uma revisão humana.
  • Planejamento editorial, para mapear o equilíbrio entre temas públicos e corporativos.

Limitações e vieses

  • Dados sintéticos: o desempenho em posts reais ainda não foi medido. Antes de usar o modelo em pesquisa, valide-o com uma amostra real anotada por pessoas.
  • Um rótulo por texto: um post pode tratar de mais de uma família. O modelo sempre escolhe uma; use as probabilidades para identificar os casos ambíguos.
  • Contexto brasileiro: a taxonomia e os exemplos refletem temas do Brasil (ex.: COP30, LGPD, reforma tributária, BRICS).
  • Idioma: foi treinado em português. O encoder é multilíngue, mas o desempenho em outros idiomas não foi avaliado.
  • Fora do escopo:
    • avaliar pessoas, empresas ou posicionamentos políticos;
    • tomar decisões automatizadas com consequências para indivíduos;
    • tratar a saída como verdade sem revisão humana.

Dica de uso: trate predições com answer_confidence abaixo de 0,5 como incertas e revise-as manualmente.

Licença e créditos

  • Licença: Apache 2.0 (ver LICENSE).
  • Modelo base: Laya, da Convai Innovations, também sob Apache 2.0. Este repositório contém pesos modificados a partir dele.
  • Encoder: mmBERT-base.
  • Taxonomia temática: relatório Presença digital dos CEOs no LinkedIn (Elementar/FGV), Anexo I.
  • Autor do fine-tuning: Mário Lúcio.

Citação

@misc{layakedin2026,
  title  = {layakedin: classificação de temas de posts de CEOs no LinkedIn em famílias temáticas},
  author = {Mário Lúcio},
  year   = {2026},
  url    = {https://huggingface.co/marioluciofjr/layakedin},
  note   = {Fine-tuning de convaiinnovations/laya (multilingual)}
}
Downloads last month
28
Safetensors
Model size
0.3B params
Tensor type
F16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for marioluciofjr/layakedin

Finetuned
(165)
this model

Evaluation results

  • Acurácia on Base sintética de temas de posts de CEOs (teste com CEOs nunca vistos)
    test set self-reported
    0.829
  • F1-macro on Base sintética de temas de posts de CEOs (teste com CEOs nunca vistos)
    test set self-reported
    0.830
  • F1-macro (somente linhas originais) on Base sintética de temas de posts de CEOs (teste com CEOs nunca vistos)
    test set self-reported
    0.556
  • Expected Calibration Error on Base sintética de temas de posts de CEOs (teste com CEOs nunca vistos)
    test set self-reported
    0.053