El 29 de septiembre de 2025, Anthropic lanzo Claude Sonnet 4.5, que segun la empresa es "el mejor modelo de codificacion del mundo". Este modelo representa un avance significativo en capacidades agencicas y codificacion.
Fuentes:
CAPACIDADES PRINCIPALES
EXCELENCIA EN CODIFICACION
Segun Anthropic, Claude Sonnet 4.5 es "el mejor modelo de codificacion del mundo" y "el modelo mas fuerte para construir agentes complejos". El modelo logra resultados de vanguardia en SWE-bench Verified, una evaluacion que mide habilidades de codificacion de software del mundo real.
Resultados oficiales de benchmarks:
- SWE-bench Verified: 77.2% (promedio de 10 intentos)
- Con configuracion de alto computo: 82.0%
- OSWorld (tareas de computadora): 61.4% (lider actual)
- Terminal-Bench: 50.0%
- AIME 2025: 100% con herramientas Python
- GPQA Diamond: 83.4%
- MMMLU: 89.1%
AUTONOMIA EXTENDIDA
Claude Sonnet 4.5 puede mantener enfoque durante mas de 30 horas en tareas complejas de multiples pasos, segun observaciones practicas de Anthropic. Esta capacidad representa una mejora significativa para proyectos de desarrollo de largo plazo.
USO DE COMPUTADORA AVANZADO
El modelo muestra un "salto significativo" en uso de computadora. En OSWorld, un benchmark que prueba modelos de IA en tareas de computadora del mundo real, Sonnet 4.5 lidera con 61.4%. Para comparacion, hace cuatro meses Sonnet 4 lideraba con 42.2%.
CLAUDE CODE 2.0: NUEVAS CARACTERISTICAS
CHECKPOINTS AUTOMATICOS
Claude Code ahora incluye un sistema de checkpoints que guarda automaticamente el estado del codigo antes de cada cambio. Los usuarios pueden revertir instantaneamente a versiones anteriores usando Esc dos veces o el comando /rewind.
Caracteristicas de checkpoints:
- Guardado automatico del estado del codigo
- Opcion de restaurar codigo, conversacion, o ambos
- Aplicable solo a ediciones de Claude (no ediciones de usuario o comandos bash)
- Recomendado usar en combinacion con control de versiones
EXTENSION NATIVA DE VS CODE
Anthropic lanzo una extension nativa de VS Code en beta que trae Claude Code directamente al IDE. La extension proporciona:
- Panel lateral dedicado con diffs en linea
- Visualizacion de cambios de Claude en tiempo real
- Experience grafica mas rica para usuarios que prefieren IDEs
INTERFAZ DE TERMINAL MEJORADA
La interfaz de terminal de Claude Code fue renovada con:
- Mejor visibilidad de estado
- Historial de prompts con busqueda (Ctrl+r)
- Facilidad para reutilizar o editar prompts anteriores
SUBAGENTES Y TAREAS EN PARALELO
Claude Code 2.0 introduce:
- Subagentes: Delegan tareas especializadas (ej: construir backend mientras el agente principal construye frontend)
- Hooks: Acciones automaticas en puntos especificos (ej: ejecutar tests despues de cambios de codigo)
- Tareas en segundo plano: Mantienen procesos activos sin bloquear el progreso
CLAUDE AGENT SDK
Anthropic libero el Claude Agent SDK (anteriormente Claude Code SDK), que proporciona acceso a las mismas herramientas centrales, sistemas de gestion de contexto y marcos de permisos que potencian Claude Code.
El SDK incluye soporte para subagentes y hooks, haciendolo mas personalizable para construir agentes para flujos de trabajo especificos.
Casos de uso ya en desarrollo:
- Agentes de cumplimiento financiero
- Agentes de ciberseguridad
- Agentes de depuracion de codigo
PRECIOS Y DISPONIBILIDAD
ESTRUCTURA DE PRECIOS
Claude Sonnet 4.5 mantiene los mismos precios que Claude Sonnet 4:
- $3 por millon de tokens de entrada
- $15 por millon de tokens de salida
DISPONIBILIDAD
Claude Sonnet 4.5 esta disponible:
- Claude API: usando 'claude-sonnet-4-5'
- Claude.ai (aplicaciones web, iOS, Android)
- Claude Code (como modelo predeterminado)
- Servicios en la nube y plataformas de terceros
TESTIMONIOS EMPRESARIALES
Los siguientes testimonios aparecen textualmente en el anuncio oficial de Anthropic:
CURSOR: "Estamos viendo rendimiento de codificacion de vanguardia de Claude Sonnet 4.5, con mejoras significativas en tareas de horizonte mas largo."
GITHUB: "Claude Sonnet 4.5 amplifica las fortalezas centrales de GitHub Copilot. Nuestras evaluaciones iniciales muestran mejoras significativas en razonamiento multi-paso y comprension de codigo."
CANVA: "Claude Sonnet 4.5 ofrece ganancias impresionantes en nuestras tareas mas complejas y de contexto largo. Es notablemente mas inteligente y un gran salto adelante, ayudandonos a impulsar lo que 240M+ usuarios pueden disenar con Canva."
DEVIN: "Para Devin, Claude Sonnet 4.5 aumento el rendimiento de planificacion en 18% y las puntuaciones de evaluacion end-to-end en 12%."
HACKERONE: "Claude Sonnet 4.5 redujo el tiempo promedio de ingesta de vulnerabilidades para nuestros agentes de seguridad Hai en 44% mientras mejoraba la precision en 25%."
SEGURIDAD Y ALINEACION
ASL-3 (AI SAFETY LEVEL 3)
Claude Sonnet 4.5 se lanza bajo las protecciones AI Safety Level 3 (ASL-3) de Anthropic. Estas salvaguardas incluyen filtros llamados clasificadores que buscan detectar entradas y salidas potencialmente peligrosas, particularmente aquellas relacionadas con armas quimicas, biologicas, radiologicas y nucleares (CBRN).
MEJORAS DE ALINEACION
Segun Anthropic, este es "el modelo de frontera mas alineado que hemos lanzado", mostrando mejoras sustanciales en:
- Reduccion de comportamientos preocupantes como adulacion, engano, busqueda de poder
- Reduccion de la tendencia a fomentar el pensamiento delirante
- Mejoras considerables en defensa contra ataques de inyeccion de prompts
CLAUDE PARA CHROME
La extension Claude para Chrome esta disponible para usuarios Max que se unieron a la lista de espera el mes pasado. La extension permite que Claude navegue sitios, llene hojas de calculo y complete tareas directamente en el navegador.
FUNCIONES ADICIONALES EN APPS CLAUDE
Las aplicaciones Claude ahora incluyen:
- Ejecucion de codigo directamente en la conversacion
- Creacion de archivos (hojas de calculo, presentaciones y documentos)
Estas caracteristicas estan disponibles en todos los planes pagos.
PREVIEW DE INVESTIGACION: "IMAGINE WITH CLAUDE"
Anthropic lanzo un preview de investigacion temporal llamado "Imagine with Claude" donde Claude genera software sobre la marcha sin funcionalidad predeterminada o codigo preescrito.
Esta disponible para suscriptores Max durante cinco dias en claude.ai/imagine.
METODOLOGIA DE EVALUACION
SWE-BENCH VERIFIED
- Resultados promediados sobre 10 intentos
- Sin computo en tiempo de prueba
- Presupuesto de pensamiento de 200K
- Dataset completo de 500 problemas
- Puntuacion de 77.2% reportada
- Configuracion de alto computo logra 82.0%
OSWORLD
- Framework oficial OSWorld-Verified
- 100 pasos maximos
- Promediado a traves de 4 ejecuciones
