MVP demo of multilingual LLM performance eval space
compare different models and their moral compass
compare responses between non-RAG and RAG model
compare different llama versions for knowledge cutoff
generates linkedin posts from freetext entries
severely limited context window proof of concept