olimposec.com
tema

#llm-security

5 publicações marcadas com esta tag.

risco médioOS-2026-277 · 2026-08-24
0

Estudo com mais de 120 LLMs revela que segurança, privacidade e alinhamento competem entre si

O aiXamine é uma plataforma de avaliação black-box que testa simultaneamente segurança, privacidade e alinhamento de segurança em LLMs, rodando 46 testes automatizados de red-teaming por modelo. Em mais de 5.000 execuções contra 120+ modelos, os autores encontraram uma 'taxa de segurança' (mais alinhamento gera mais recusas indevidas), privacidade quase independente das demais dimensões, e um colapso catastrófico de robustez em modelos destilados sem correção on-policy.

Fonte ↗
risco médioOS-2026-283 · 2026-08-24
0

LLMs mostram raciocínio de segurança 'frágil': reformular o mesmo problema muda o ranking de defesas escolhidas

Testando LLMs na seleção de controles de segurança sobre grafos de ataque reais (ransomware, comprometimento de cadeia de suprimento, Kubernetes, ICS/OT), pesquisadores encontraram que os modelos produzem estratégias próximas de um baseline de otimização matemática quando a estrutura do ataque é explícita, mas a qualidade despenca com a complexidade do grafo e é muito sensível a mudanças de formulação do prompt — inclusive apenas rotular uma estratégia ruim como 'ótima' melhora drasticamente a avaliação que o próprio LLM dá a ela.

Fonte ↗
panoramaOS-2026-109 · 2026-07-30
0

GPT-Red: agente de IA treinado para descobrir sozinho novos ataques de prompt injection em escala

Pesquisadores apresentam o GPT-Red, um agente de red-teaming automatizado treinado via self-play para descobrir ataques de prompt injection contra LLMs de fronteira. O sistema foi usado para treinar adversarialmente o GPT-5.6, tornando-o mais robusto a esse tipo de ataque. Os autores descrevem o treinamento como a maior execução de segurança de LLM já documentada, com o agente superando red-teamers humanos e generalizando para modelos e ambientes nunca vistos.

Fonte ↗
risco médioOS-2026-112 · 2026-07-30
0

Guards de modelos de visão-linguagem ainda falham contra jailbreaks codificados, mesmo com defesa amplificada

Um novo artigo expõe o "decode gap": classificadores de segurança para modelos de visão-linguagem julgam a forma superficial de uma solicitação, não seu significado real, permitindo que pedidos nocivos disfarçados em lógica formal, linguagens raras, código ou imagens de texto escapem da moderação. Os autores propõem um amplificador que tenta neutralizar esse desvio antes do guard atuar, mas mostram que mesmo a melhor combinação ainda deixa 63-65% dos ataques passarem, e o remédio para isso dispara recusas indevidas em pedidos legítimos.

Fonte ↗
risco médioOS-2026-113 · 2026-07-30
0

Pesquisadores quebram defesa de jailbreak SAGE (99% de sucesso) combinando dois ataques fracos isoladamente

Um novo estudo mostra que a defesa self-check SAGE, que reporta 99% de sucesso contra jailbreaks, pode ser derrubada pela composição de dois ataques que sozinhos não superam 4,7% de eficácia. Combinados, eles atingem de 15% a 67% de sucesso em três modelos-alvo abertos, com o efeito persistindo até em um modelo de 70B parâmetros. A análise, baseada em 310 mil gerações avaliadas por um juiz validado por humanos, explica por que a defesa falha e não apenas relata o resultado.

Fonte ↗