Taalas desarrolló un chip capaz de ejecutar Llama 3.1 8B a casi 17.000 tokens por segundo, al integrar directamente los pesos del modelo en el silicio en lugar de depender constantemente de la memoria.
AMD ya firmó un acuerdo para adquirir la empresa e integrar esta tecnología con sus aceleradores Instinct.
Los próximos chips podrían diseñarse para modelos concretos y eso significaría actualizar el hardware cada vez que aparezca una generación importante de IA, pero a cambio los agentes podrían generar tokens, razonar durante más tiempo y ejecutar muchos más pasos casi en tiempo real.
El futuro quizá no sea “instalar un modelo”, sino cambiar de chip cuando salga uno mejor. La obsolescencia programada acaba de recibir una actualización con esteroides.





