Arxiv Dives - Toolformer: Language models can teach themselves to use tools
Arxiv Dives - Self-Rewarding Language Models
Arxiv Dives - Direct Preference Optimization (DPO)
Arxiv Dives - Efficient Streaming Language Models with Attention Sinks