Gerar e avaliar dados sintéticos para detecção de malware Android é caro, só o conjunto MH100k somaria ~28.583 h (cerca de 3 anos) de execução. Este projeto ataca esse custo por etapas.
Fase 1 otimiza a busca de hiperparâmetros (Tune3). Fase 2 reduz a dimensionalidade e balanceia os dados, dois métodos novos e 33+ datasets preparados. Fase 3 executa os experimentos finais em larga escala.
Estimativa do tempo total para otimizar os modelos generativos em todos os 11 datasets. Partindo do custo medido na ferramenta de geração (Malsyngen), cada fase do projeto corta uma fatia do tempo: a redução é progressiva e acumulativa.
Cada etapa é uma contribuição independente, e, somadas, tornam viável uma campanha experimental que, na configuração original, levaria anos de processamento.
Reduz progressivamente o espaço de busca em vez de varrê-lo. Iguala ou supera o Random Search testando menos.
Encolhe os atributos e corrige (quando vale a pena) o desbalanceamento, gerando dezenas de versões de dataset prontas para experimentação.
Combina HPO (Fase 1) + datasets reduzidos e balanceados (Fase 2) para a avaliação ampla e definitiva da geração de dados sintéticos.
O espaço de busca explode (1.125 configurações na grade de referência) e varrê-lo é caro. O Tune3 não faz busca exaustiva, afunila as configurações em três estágios encadeados, descartando o que é instável ou inviável e concentrando esforço onde há maior potencial.
Parte de valores plausíveis vindos da literatura, de testes empíricos ou definidos pelo usuário, estabelecendo um espaço amplo, porém realista.
Explora regiões contrastantes do espaço com variação controlada, testando extremos e filtrando execuções instáveis antes de gastar recursos com elas.
Concentra a busca nas combinações mais promissoras segundo Recall e F1‑score, iterando até não haver mais melhoria, então retorna as configurações finais.
Datasets de malware Android costumam ter milhares de atributos e classes desbalanceadas. A Fase 2 introduz duas contribuições independentes, uma de seleção de características e outra de balanceamento, validadas em 11 datasets via 5-fold estratificado, com a seleção integrada dentro de cada fold para evitar vazamento de dados.
Um ensemble de seleção por votação: cada atributo só é mantido se aparecer entre os mais relevantes para pelo menos 2 de 3 rankers independentes, Qui-quadrado (χ²), Informação Mútua e importância de Random Forest. A combinação de critérios estatístico, informacional e baseado em modelo elimina redundância sem o viés de uma única lógica.
Balancear não é um passo de pré-processamento neutro. Comparando estratégias de undersampling, híbridas e oversampling em 11 datasets, o método mostra que o ganho depende da estrutura do conjunto, e propõe esparsidade e diversidade como os primeiros indicadores que preveem quando o balanceamento ajuda ou atrapalha.
Cada um dos 11 conjuntos Android foi caracterizado, reduzido pela seleção de características e balanceado, produzindo versões original, reduzida e balanceada de cada base. Esse acervo, por si só, é uma contribuição significativa e o insumo direto da Fase 3.
Acessar o repositório de datasets ↗| Dataset | Ano | Amostras | Atributos | Reduzido | Redução | Exec. original |
|---|---|---|---|---|---|---|
| MH100kDataset100k · 2023 | 2023 | 101.934 | 24.833 | ~1.240 | 99,6% | 28.583,6 h |
| KronoDroid Real | 2021 | 78.137 | 286 | 29 | 89,9% | 280,6 h |
| KronoDroid Emulator | 2021 | 63.991 | 276 | 25 | 90,9% | 234,9 h |
| AndroCrawl | 2013 | 96.744 | 141 | 12 | 91,5% | 182,7 h |
| Android Permissions | 2018 | 26.864 | 151 | 46 | 69,5% | 73,8 h |
| DREBIN-215 | 2018 | 15.031 | 215 | 64 | 70,2% | 64,4 h |
| DefenseDroid PRS | 2021 | 11.975 | 2.877 | 144 | 95,0% | 416,4 h |
| DefenseDroid API Katz | 2021 | 10.476 | 6.002 | 300 | 95,0% | 736,9 h |
| DefenseDroid API Degree | 2021 | 10.476 | 6.002 | 300 | 95,0% | 736,9 h |
| DefenseDroid API Closeness | 2021 | 10.476 | 4.274 | 213 | 95,0% | 532,8 h |
| Adroit | 2016 | 11.476 | 166 | 66 | 60,2% | 49,4 h |
// atributos reduzidos pela seleção de características (Fase 2); tempo de execução medido na geração/avaliação de dados sintéticos (Malsyngen).
Trabalhos recentes em RNAs geradoras e classificadoras concentram-se em ajuste manual, Grid Search ou Random Search. Nenhum reduz o espaço progressivamente nem prioriza explicitamente o risco.
| Abordagem | Busca direcionada | Redução progressiva | Prioriza risco (Recall) | Reuso via cache | Custo |
|---|---|---|---|---|---|
| Ajuste manualXu et al. 2024 · Li et al. 2022 | não | não | não | não | alto / tentativa e erro |
| Grid SearchZhou et al. 2020 · Basri et al. 2023 | não | não | não | não | alto |
| Grid / Random SearchNurhayati et al. 2021 | parcial | não | não | não | médio |
| Tune3este trabalho · CGAN | sim | sim | sim | sim · SQLite | baixo |
Com as três fases acopladas, a campanha experimental final percorre todos os 33+ datasets: o Tune3 (Fase 1) escolhe as configurações promissoras e os dados reduzidos e balanceados (Fase 2) cortam drasticamente o custo de cada execução. O que antes exigiria anos passa a caber em dias.
Versões reduzidas e balanceadas de 11 bases Android, menos atributos, distribuição tratada, mesma capacidade discriminativa.
O Tune3 evita varrer o espaço inteiro de hiperparâmetros, concentrando execuções nas regiões promissoras de cada dataset.
Comparação extensiva da geração de dados sintéticos (Malsyngen/CGAN) entre datasets, métricas e estratégias, em escala antes inviável.
Em resumo: o projeto transforma um experimento proibitivamente caro em um processo factível. A Fase 1 mira a busca, a Fase 2 enxuga e equilibra os dados (com dois métodos novos e 33+ datasets), e a Fase 3 colhe o resultado, uma avaliação intensiva da síntese de dados para detecção de malware Android, onde tempo, estabilidade e sensibilidade a falsos negativos são fatores críticos.
Defesa pública de mestrado no PPGES/UNIPAMPA, Alegrete, 2026. Abaixo, o primeiro slide da apresentação (com link para o PDF completo) e a banca examinadora reunida na sessão.