Mostrando postagens com marcador Software. Mostrar todas as postagens
Mostrando postagens com marcador Software. Mostrar todas as postagens

microdadosBrasil: PNAD, POF, Censo 2000/2010 e os Censos do INEP

O grande Lucas Mation (Ipea-BSB) preparou um pacote do R para o acesso a uma penca de microdados de pesquisas oficiais. Muito obrigado !
(Lucas era um militante do Stata e discutíamos as vantagens de um e outro programa enquanto engolíamos PFs preparados por vendedores de rua com critérios questionáveis de higiene.  Será que agora ele se converteu?)

Atualização: para o Censo de 2010, o Rafael Pereira preparou um código bem rápido.

Censo 2010 no R

O UrbanDemographics mandou essa dica nos comentários de um post anterior:
"O Anthony e o Djalma sao fora de serie. Mas confesso que nao gostei muito de usar o monetdb, entao eu criei um script em R "puro sangue" para download dos dados. O script eh bem rapido. Qualquer comentario e sugestao eh bem vindo. https://github.com/rafapereirabr/Brazilian_Census_2010"
Valeu!
Lembro que os usuários de Stata tem o ótimo site Data Zoom da turma da PUC-RJ para baixar Censos e Pnads.

Pacote do R para estudar o legislativo brasileiro

Aqui. Quem deu a dica foi o Urban Demographics.

Dois pacotes essenciais para ansiosos que precisam ler 50 milhões de observações no R

  • data.table: é muito rápido que a concorrência e - melhor ainda - indica o percentual do progresso na leitura do arquivo;
  • beepr: faz um beep quando o script termina.

Diversos: ferramentas para R e Latex

DataJoy: para quem quiser rodar R ou Python on-line;
ShareLatex: editor colaborativo de Latex;
RegExr: para testar regular expressions.


"Avaliação da Qualidade do Gasto Público e Mensuração da Eficiência"

O livro foi lançado ontem está disponível para download gratuito no site da Secretaria do Tesouro. A publicação já estava sendo preparada faz um bom tempo pelos organizadores: Fabiana Rocha, Fabiana Rodopoulos e  Rogério Boueri ( meu amigo e ex-chefe no Ipea).
Os autores dos textos são os craques na discussão sobre eficiência -com ênfase em DEA-  no Brasil. Tem até uma introdução a utilização de análise envoltória de dados no R (cap 10).

Precisa limpar bases de dados? Seus problemas acabaram

Basta usar o Open Refine. Era um produto da Google e passou a ser um produto separado.
É bem fácil de usar e com ferramentas que parecem mágica.
Eu optei por não usar no meu projeto atual, porque quero ter a documentação da limpeza para ser capaz de reproduzi-la  mais adiante.



Web scraping para seres humanos

Mesmo sem saber nada sobre o assunto, com umas oito horas de trabalho,  eu fiz um código no R que: 1) leu milhares de páginas na internet; 2) selecionou as informações que eu precisava; 3) pôs tudo em formato de tabela.
Acreditem: você não precisa ter menos de 25 anos para aprender isso, nem ser um gênio da computação. É moleza, desde que você tenha as ferramentas certas. As duas que eu usei foram:
- rvest: todas as funções necessárias em um só pacote;
- selectorgagdet: ele te mostra onde pescar a informação que você deseja nos arquivos html.
Esse post e o próprio demo do rvest explicam o básico.
Em breve, eu postarei aqui alguns resultados do processo. (Ainda falta gastar umas 20 horas limpando os dados...) 

HistData: o pacote mais sensacional possível

Michael Friendly (o nome diz tudo) fez o favor de juntar um monte de bases históricas muito inusitadas em um só pacote para o R. Ele  traz desde os dados do Cavendish (1798) para a calcular a densidade da Terra, as medidas de altura do Galton (o da falácia), o mapa da cólera do John Snow, um experimento maluco do Jevons e mais um monte de outras bases.

Diversos

Diversos, só nerdices


Transição do Word para o LaTex para dummies (eu)

Eu faço parte da geração que emburreceu usando Windows/Office, mas quero me recuperar. Mentira: o motivo é que dois coautores atuais usam LaTeX e eu não quero parecer idoso. Além disso, cada vez mais os journals pedem os artigos no formato tex. Aí vão os meus passos.
  1. Fiz o download do proTeXt: é um pacotaço (1 giga e tanto) que vem com tudo que você vai precisar. Usei o TeXStudio como editor.
  2. Instalei o Writer2LaTeX e abri um docx para o LibreOffice e este plugin gerou um arquivo tex bem limpo. Tudo bem que era um docx simples, mas funcionou muito bem. É bom ver o seu próprio texto no formato;
  3. Como preciso colaborar, eu testei o Overleaf:, Google docs para escrever documentos colaborativos em LaTeX. Parece fácil, bem feito e prático. Colei o arquivo tex e funcionou direitinho.
  4. Minha primeira tentativa de gerar uma tabela no LaTex deu errado. Mas descobri um gerador de tabelas e quadros em LaTeX (e R Markdown) que faz isso, sem você saber nada de código;
  5. Não gostei muito do LyX, o editor Wysiwyg para LaTeX. Parece uma gambiarra e acho que não vai se tornar padrão.
  6. Ainda não encarei passar a bibliografia do amado Zotero para o BibTeX. Depois eu conto.
Enfim, eu ainda não cheguei lá, mas o meu objetivo ainda é seguir a dica mais importante deste blog.

Plugin para restringir a procrastinação

  • StayFocusd (Chrome) - Gratuito e muito bom. Tem até um modo que só permite mudanças de configuração se você resolver um enigma.

Analisar POF, PNAD, Censo, Pisa... com o R

Aqui. Bonus: os tutorials desse cara são muito bons.
Obrigado, Lucas Mation (que está em processo de conversão ao R). 

A dica mais importante deste blog

...para jovens economistas aplicados: Code and Data for the Social Sciences: a Practioner's Guide por Gentzkow e Shapiro. (O primeiro ganhou a John Bates Clark).
Leia o texto ou veja o vídeo (é o último da lista), mas faça o favor a si mesmo e aprenda as técnicas. Eu já enfrentei todos os problemas e cometi todos os erros que eles apontam. Ah, se eu tivesse lido isso antes... (Dica do Lucas Mation).

Saídas de regressão bonitinhas no R

Você perde um tempão reformatando tabelas de regressão? Está com inveja do outreg do stata? Seus problemas acabaram! Chegou texreg para o R.
Basta fazer htmlreg(objeto_saída_regressão) que ele gera um tabela profissa. Ah, faz tabelas LaTeX também. Mais informações aqui.

Atualização: Vanessa Nadalin, minha colega do Ipea, me avisa que a biblioteca não funciona no spdep (o pacote de econometria espacial). Ao que parece, é ainda melhor usar o pacote stargazer, porque ele aceita uma ampla gama de tipos de objeto.

Atualização 2: Nos comentários, Danilo faz coro em favor do stargazer. É bacana mesmo e, se você for ambicioso, ele até gera direto a tabela no formato da American Economic Review. (Eu confesso que estou com um erro esquisito no stargazer. Já fiz o update para versão 4.5, mas o erro segue. Pode ser problema meu.)

Nate SIlver usa Stata...

mas quer migrar para o R, segundo ele revela nessa conversa com o Hal Varian (19m 30s).

Painel Espacial no R

O Gianfranco Piras, um dos autores da biblioteca do splm, está aqui na Enaber. A biblioteca faz painel, painel espacial, cozinha, passa e faz café. O Rogério Boueri usou o splm em um artigo em andamento no qual Lucas Mation e eu somos coautores.  O treco funciona mesmo. Estou ensaiando para dizer "Grazie mille!" para o Piras.
Falando em R: o C Shikida - aquele que não acredita em divisão do trabalho- manda um link para algo muito bacana mesmo: gráficos no R com cara de XKCD (ou Economist ou até os horrorosos do excel 2003).

Precisa limpar dados?

Google refine!
De nada.

Zotero 3.0 com tutorial

Eu continuo na campanha pelo uso do Zotero 3.0. Tomei coragem e agora estou até usando o plug-in do Word. Um tutorial no youtube (feito pela bolsista Juliana Régis) é uma mão na roda para os primeiros passos. O formato de citação ABNT e suas variantes (inclusive Ipea) já estão disponíveis.
(Agradeço ao Paul Nascimento, Lucas Mation e à Juliana Régis pelas aulas e desenvolvimento)
Tecnologia do Blogger.