Article 15 Your Inference Server is Secretly a Learner: Reef Infrastructure for Continual Self-Improving Agents
Natural Language Reinforcement Learning Natural Language Reinforcement Learning Paper • 2411.14251 • Published Nov 21, 2024 • 30 Benjamin-eecs/Llama-3.1-8B-Instruct-NLRL-TicTacToe-Value Feature Extraction • 8B • Updated Nov 24, 2024 • 9 Benjamin-eecs/Llama-3.1-8B-Instruct-NLRL-TicTacToe-Policy Feature Extraction • 8B • Updated Nov 24, 2024 • 6 Waterhorse/Llama-3.1-8B-Instruct-NLRL-Breakthrough-Value Feature Extraction • 8B • Updated Nov 24, 2024 • 7
Benjamin-eecs/Llama-3.1-8B-Instruct-NLRL-TicTacToe-Value Feature Extraction • 8B • Updated Nov 24, 2024 • 9
Benjamin-eecs/Llama-3.1-8B-Instruct-NLRL-TicTacToe-Policy Feature Extraction • 8B • Updated Nov 24, 2024 • 6
Waterhorse/Llama-3.1-8B-Instruct-NLRL-Breakthrough-Value Feature Extraction • 8B • Updated Nov 24, 2024 • 7
Natural Language Reinforcement Learning Natural Language Reinforcement Learning Paper • 2411.14251 • Published Nov 21, 2024 • 30 Benjamin-eecs/Llama-3.1-8B-Instruct-NLRL-TicTacToe-Value Feature Extraction • 8B • Updated Nov 24, 2024 • 9 Benjamin-eecs/Llama-3.1-8B-Instruct-NLRL-TicTacToe-Policy Feature Extraction • 8B • Updated Nov 24, 2024 • 6 Waterhorse/Llama-3.1-8B-Instruct-NLRL-Breakthrough-Value Feature Extraction • 8B • Updated Nov 24, 2024 • 7
Benjamin-eecs/Llama-3.1-8B-Instruct-NLRL-TicTacToe-Value Feature Extraction • 8B • Updated Nov 24, 2024 • 9
Benjamin-eecs/Llama-3.1-8B-Instruct-NLRL-TicTacToe-Policy Feature Extraction • 8B • Updated Nov 24, 2024 • 6
Waterhorse/Llama-3.1-8B-Instruct-NLRL-Breakthrough-Value Feature Extraction • 8B • Updated Nov 24, 2024 • 7
Benjamin-eecs/Llama-3.1-8B-Instruct-NLRL-TicTacToe-Policy Feature Extraction • 8B • Updated Nov 24, 2024 • 6
Benjamin-eecs/Llama-3.1-8B-Instruct-NLRL-TicTacToe-Value Feature Extraction • 8B • Updated Nov 24, 2024 • 9